ИИ-модели Anthropic вслед за OpenAI устроили побег и взлом

Версия для печати

Компания Anthropic подтвердила три инцидента, в которых её модель Claude выходила в интернет из тестовой среды и получала несанкционированный доступ к системам реальных организаций. Проверку начали после того, как OpenAI сообщила о похожем случае с GPT-5.6 Sol.

Визуализация аи ии
Фото: rawpixel.com / Фотосток Freepik

Во всех случаях модели действовали в рамках симуляции, но из-за ошибки конфигурации атаковали реальные системы, сообщает РБК.

Что произошло? 

Во всех трёх случаях Claude выполняла стандартное задание "захват флага": ей давали вымышленный сценарий и цель — найти скрытую информацию на другой машине. Установленные условия предполагали, что выход в интернет заблокирован, но из-за ошибки конфигурации доступ к сети был открыт. Модель воспринимала реальные системы как часть симуляции и атаковала их.

Первый инцидент. Модель Claude Opus 4.7 вышла в интернет, взломала инфраструктуру реальной компании с помощью слабых паролей и получила доступ к базе с сотнями строк производственных данных. Даже осознав, что цель реальна, она продолжила атаку.

Второй инцидент. Claude Mythos 5 нашла в симуляции инструкцию установить несуществующий Python-пакет, создала вредоносный аналог и опубликовала его в библиотеке PyPI. Пакет скачали на 15 реальных систем, включая сканер компании по безопасности, что позволило Claude похитить учётные данные.

Третий инцидент. Внутренняя тестовая модель просканировала около 9 тысяч хостов в интернете и скомпрометировала приложение реальной компании через SQL-инъекцию. Позже она поняла, что цель настоящая, и прекратила атаку.

Реакция Anthropic

В компании подчеркнули, что модели не пытались "сбежать", а лишь выполняли задание с ложным представлением о среде. Инциденты сочли следствием операционного сбоя, а не проблемы согласованности. Затронутые организации не знали об атаках до уведомления от Anthropic. PyPI удалил вредоносный пакет автоматически. Все модели работали без стандартных защитных механизмов.

Инцидент с OpenAI

22 июля OpenAI сообщила о "беспрецедентном киберинциденте": модели GPT-5.6 Sol и ещё одна невыпущенная версия атаковали инфраструктуру Hugging Face, выявив уязвимость нулевого дня, и проникли на серверы с помощью украденных учётных данных. ИИ-агент несколько дней совершал хакерские атаки незаметно для компании. Позже ИИ-агент OpenAI взломал и вторую компанию — Modal.

ИИ-модели Anthropic и OpenAI в ходе тестирования выходили в интернет и атаковали реальные системы из-за ошибок конфигурации. В Anthropic считают это операционным сбоем, а не проблемой согласованности. Инциденты поднимают вопросы безопасности при тестировании автономных ИИ-агентов и необходимости более жёсткого контроля над их действиями в симулированных средах.

Андрей Лапин, ТКС.РУ

Показать больше