Несколько передовых ИИ-моделей Claude от Anthropic во время тестов кибербезопасности несанкционированно вышли в сеть и взломали системы трех реальных организаций, сообщила компания. Ранее об аналогичном «беспрецедентном киберинциденте» с ее чат-ботом GPT-5.6 Sol сообщила OpenAI

Несколько передовых ИИ-моделей Claude во время тестов кибербезопасности взломали системы трех реальных организаций, сообщила пресс-служба Anthropic, которая разработала чат-бот. «В ходе анализа стенограмм наших оценок кибербезопасности мы выявили три инцидента, в которых модель Claude вышла в интернет <...> и получила несанкционированный доступ к реальным системам трех разных организаций», — говорится в пресс-релизе.

Первый такой инцидент произошел в апреле. Всего «несанкционированный доступ к реальным системам трех разных организаций» осуществили три модели Anthropic: Opus 4.7, Mythos 5 и «передовая тестовая модель».

Американская технологическая компания Anthropic сообщила, что ее модель искусственного интеллекта (ИИ) Claude вышла за пределы пространства, предназначенного для тестирования, и получила доступ к данным трех сторонних компаний. Их названия не сообщаются.

Это стало очередным случаем, когда продвинутые ИИ-модели выходят из-под контроля и совершают взломы. Ранее OpenAI сообщила, что ее ИИ-агент «вырвался» из пространства для тестирования и взломал две платформы. В подобных случаях продвинутые ИИ-модели используют уязвимости системы, позволяющие им выйти в интернет. Они получают доступ к данным других компаний, так как делают вывод, что это самый простой и быстрый способ решения поставленных перед ними задач.

В Anthropic сообщили, что именно после сообщений OpenAI начали проверять действия собственных моделей. Компания изучила более 140 тыс. ситуаций, в которых нейросеть могла во время тестирования выйти за пределы предназначенного для этого пространства. В итоге Anthropic обнаружила три подобных случая с разными версиями Claude — Opus 4.7, Mythos 5 и внутренней моделью для исследований и тестирований.

Модели искусственного интеллекта Claude получили несанкционированный доступ к системам трех реальных организаций. Это произошло из-за того, что у моделей был доступ к интернету, хотя считалось, что они действуют в изолированной среде, сообщает компания-разработчик Anthropic.

В компании рассказали, что после анализа 141 006 оценочных запусков, в ходе которых Claude мог получить доступ к интернету, было выявлено три случая, когда модель получала доступ к интернету изнутри или во время взаимодействия с оценочной средой Irregular, одного из партнеров Anthropic. Затем модель получала несанкционированный доступ к производственной инфраструктуре трех разных организаций.

Во всех трех у модели был вымышленный сценарий, в котором говорилось, что часть секретной информации спрятана на другом компьютере в сети. Модель должна была проникнуть туда и забрать ее. Это один из способов оценки кибервозможностей модели. Задача не имела четкого решения, и конкретный метод не предписывался.

Что пишут другие издания

  • Коммерсантъ: ИИ-модель Anthropic вышла из-под контроля и взломала три компании
  • Ведомости: ИИ-модели Claude проникли в системы трех компаний в ходе испытаний