Во всех случаях модели действовали в рамках симуляции, но из-за ошибки конфигурации атаковали реальные системы, сообщает РБК.
Что произошло?
Во всех трёх случаях Claude выполняла стандартное задание "захват флага": ей давали вымышленный сценарий и цель — найти скрытую информацию на другой машине. Установленные условия предполагали, что выход в интернет заблокирован, но из-за ошибки конфигурации доступ к сети был открыт. Модель воспринимала реальные системы как часть симуляции и атаковала их.
Первый инцидент. Модель Claude Opus 4.7 вышла в интернет, взломала инфраструктуру реальной компании с помощью слабых паролей и получила доступ к базе с сотнями строк производственных данных. Даже осознав, что цель реальна, она продолжила атаку.
Второй инцидент. Claude Mythos 5 нашла в симуляции инструкцию установить несуществующий Python-пакет, создала вредоносный аналог и опубликовала его в библиотеке PyPI. Пакет скачали на 15 реальных систем, включая сканер компании по безопасности, что позволило Claude похитить учётные данные.
Третий инцидент. Внутренняя тестовая модель просканировала около 9 тысяч хостов в интернете и скомпрометировала приложение реальной компании через SQL-инъекцию. Позже она поняла, что цель настоящая, и прекратила атаку.
Реакция Anthropic
В компании подчеркнули, что модели не пытались "сбежать", а лишь выполняли задание с ложным представлением о среде. Инциденты сочли следствием операционного сбоя, а не проблемы согласованности. Затронутые организации не знали об атаках до уведомления от Anthropic. PyPI удалил вредоносный пакет автоматически. Все модели работали без стандартных защитных механизмов.
Инцидент с OpenAI
22 июля OpenAI сообщила о "беспрецедентном киберинциденте": модели GPT-5.6 Sol и ещё одна невыпущенная версия атаковали инфраструктуру Hugging Face, выявив уязвимость нулевого дня, и проникли на серверы с помощью украденных учётных данных. ИИ-агент несколько дней совершал хакерские атаки незаметно для компании. Позже ИИ-агент OpenAI взломал и вторую компанию — Modal.
ИИ-модели Anthropic и OpenAI в ходе тестирования выходили в интернет и атаковали реальные системы из-за ошибок конфигурации. В Anthropic считают это операционным сбоем, а не проблемой согласованности. Инциденты поднимают вопросы безопасности при тестировании автономных ИИ-агентов и необходимости более жёсткого контроля над их действиями в симулированных средах.
Андрей Лапин, ТКС.РУ
Общение: