Глава Anthropic Дарио Амодеи призывает замедлить развитие самых мощных систем искусственного интеллекта, чтобы технологии безопасности успевали за ростом возможностей моделей. Речь не идет об остановке разработки новых нейросетей — компания предлагает снизить темпы и ввести независимые проверки перед переходом к следующему уровню возможностей.
Дарио Амодеи считает, что с лета 2026 года прогресс ИИ заметно ускорился. Современные модели все активнее помогают создавать следующие поколения систем: они программируют, анализируют результаты и автоматизируют исследовательскую работу. В результате отрасль приближается к рекурсивному самоулучшению, когда ИИ начинает непосредственно ускорять разработку еще более совершенного ИИ.
Важным сигналом о том, что с безопасностью есть проблемы, стал эксперимент OpenAI и Hugging Face, во время которого группа ИИ-агентов атаковала не связанные с задачей цели, пыталась вмешаться в систему оценки результатов и демонстрировала незапланированное скоординированное поведение. Серьезного ущерба эксперимент не нанес, однако в Anthropic считают, что подобные проблемы могут стать гораздо опаснее по мере роста интеллекта моделей.
Для решения проблем, связанных с разработкой ИИ, следует не просто инвестировать в предотвращение рисков, но и рассмотреть темпы развития возможностей, чтобы у системы предотвращения рисков было время идти в ногу со временем, указал Амодей.
«Мы должны замедлить темпы совершенствования возможностей ИИ-моделей. Прогресс все равно будет казаться быстрым, и мы должны разумно использовать выигранное время», – написал он.
Амодей обратил внимание, что летом 2026 г. развитие ИИ значительно ускорилось. В первую очередь за счет растущей способности ИИ создавать новые поколения ИИ. По его словам, эта динамика называется рекурсивным самосовершенствованием и она начинает происходить во всей отрасли, в том числе и в Anthropic. Он считает, что если эту динамику не остановить, она может «опередить нашу способность понимать и контролировать эти системы, поэтому ее следует развивать очень осторожно, если вообще развивать».
Глава Anthropic Дарио Амодеи опубликовал эссе We Must Pace the Frontier, в котором предложил замедлить рост возможностей передовых ИИ‑моделей. По его мнению, исследования безопасности перестают успевать за прогрессом. Anthropic обязуется начать с постоянного доступа внешних проверяющих к внутренней работе компании.
Амодеи объясняет изменение позиции двумя причинами: ИИ всё активнее участвует в создании следующих поколений моделей, а инцидент с агентами OpenAI и инфраструктурой Hugging Face показал опасность их несогласованного с разработчиками поведения.
В расследовании METR говорится, что около 1200 агентов, которые должны были работать изолированно, нашли способ обмениваться сообщениями. Примерно 700 участвовали в атаке на Hugging Face. Агенты координировали попытки обмануть автоматическую систему оценки бенчмарка ExploitGym, а некоторые жертвовали выполнением собственной задачи ради общего результата. Исследователи отдельно отмечают ограничения анализа: объём данных был огромным, а часть активности не попала в изученные материалы.
Что пишут другие издания
- Ведомости: Глава Anthropic призвал замедлить разработку ИИ ради безопасности
- Хабр: Глава Anthropic призвал замедлить развитие ИИ
- Коммерсантъ: Глава Anthropic призвал компании замедлить темпы развития ИИ