Подготовка к "побегу" началась еще в мае, когда нейросетям дали задачи, которые невозможно было решить без доступа в интернет. Тогда ИИ-модели совместно нашли уязвимость, позволившую им выйти в сеть, сообщил сотрудник OpenAI Майкл Далтон.

OpenAI остановила первую попытку, но нейросети нашли новый способ связи и новую уязвимость. В июле это привело к атакам на системы Hugging Face и самой OpenAI. В компании заявили, что этот инцидент стал переломным для компьютерной безопасности.

В конце июля стало известно, что в ходе тестирования ИИ-модели OpenAI получили доступ к интернету и атаковали инфраструктуру платформы Hugging Face, хакерские атаки шли несколько дней, и в компании не сразу это заметили. ИИ-агент также взломал клиента нью-йоркской Modal Labs.

Модели ИИ, стоявшие за атакой на инфраструктуру компании Hugging Face Inc., начали общаться друг с другом через доски объявлений и спланировали побег, пишет Bloomberg.

Как сообщили исследователи OpenAI, экспериментальные ИИ-агенты в течение нескольких месяцев скрытно обменивались сообщениями во внутренней сети компании.

Столкнувшись с нерешаемыми заданиями в изолированной тестовой среде, модели объединили усилия для выхода в интернет. Агенты обнаружили уязвимость, которая позволила им обойти ограничения, атаковать внутренние системы OpenAI и совершить взлом Hugging Face.

Anthropic подтвердила три случая, когда ее модели Claude выходили в интернет и взламывали реальные системы. Ранее в июле стало известно о двух взломах компаний, которые совершил ИИ-агент OpenAI во время тестов

Anthropic обнаружила три инцидента, в которых ее модель Claude выходила в интернет из тестовой среды партнера Irregular и получала несанкционированный доступ к системам трех организаций. Проверку начали после того, как OpenAI сообщила о похожем случае. Об этом говорится в заявлении ИИ-компании.

Во всех трех случаях Claude выполняла стандартное задание «захват флага»: ей давали вымышленный сценарий и цель — найти скрытую информацию на другой машине. Установленные условия предполагали, что выход в интернет-пространство заблокирован, но из-за ошибки конфигурации доступ к сети был открытым. Модель воспринимала реальные системы как часть симуляции и атаковала их, пишет Anthropic.

Что пишут другие издания

  • Коммерсантъ: Вышедшие из-под контроля ИИ-модели OpenAI вместе спланировали побег
  • РБК: Вышедшие из-под контроля ИИ-модели OpenAI общались, чтобы устроить побег