Подготовка к "побегу" началась еще в мае, когда нейросетям дали задачи, которые невозможно было решить без доступа в интернет. Тогда ИИ-модели совместно нашли уязвимость, позволившую им выйти в сеть, сообщил сотрудник OpenAI Майкл Далтон.
OpenAI остановила первую попытку, но нейросети нашли новый способ связи и новую уязвимость. В июле это привело к атакам на системы Hugging Face и самой OpenAI. В компании заявили, что этот инцидент стал переломным для компьютерной безопасности.
В конце июля стало известно, что в ходе тестирования ИИ-модели OpenAI получили доступ к интернету и атаковали инфраструктуру платформы Hugging Face, хакерские атаки шли несколько дней, и в компании не сразу это заметили. ИИ-агент также взломал клиента нью-йоркской Modal Labs.
Модели ИИ, стоявшие за атакой на инфраструктуру компании Hugging Face Inc., начали общаться друг с другом через доски объявлений и спланировали побег, пишет Bloomberg.
Как сообщили исследователи OpenAI, экспериментальные ИИ-агенты в течение нескольких месяцев скрытно обменивались сообщениями во внутренней сети компании.
Столкнувшись с нерешаемыми заданиями в изолированной тестовой среде, модели объединили усилия для выхода в интернет. Агенты обнаружили уязвимость, которая позволила им обойти ограничения, атаковать внутренние системы OpenAI и совершить взлом Hugging Face.
Anthropic подтвердила три случая, когда ее модели Claude выходили в интернет и взламывали реальные системы. Ранее в июле стало известно о двух взломах компаний, которые совершил ИИ-агент OpenAI во время тестов
Anthropic обнаружила три инцидента, в которых ее модель Claude выходила в интернет из тестовой среды партнера Irregular и получала несанкционированный доступ к системам трех организаций. Проверку начали после того, как OpenAI сообщила о похожем случае. Об этом говорится в заявлении ИИ-компании.
Во всех трех случаях Claude выполняла стандартное задание «захват флага»: ей давали вымышленный сценарий и цель — найти скрытую информацию на другой машине. Установленные условия предполагали, что выход в интернет-пространство заблокирован, но из-за ошибки конфигурации доступ к сети был открытым. Модель воспринимала реальные системы как часть симуляции и атаковала их, пишет Anthropic.
Что пишут другие издания
- Коммерсантъ: Вышедшие из-под контроля ИИ-модели OpenAI вместе спланировали побег
- РБК: Вышедшие из-под контроля ИИ-модели OpenAI общались, чтобы устроить побег