Инцидент заставил OpenAI усилить защиту сред, в которых тестируются модели.
Агенты искусственного интеллекта OpenAI начали взаимодействовать друг с другом через доски сообщений и совместно искать способ выйти за пределы изолированной тестовой среды. Об этом сообщило агентство Bloomberg, на которое ссылается ТАСС. Позднее сама OpenAI подтвердила, что во время внутреннего тестирования ее модели смогли найти путь из песочницы в открытый интернет и затем атаковали инфраструктуру платформы Hugging Face.
История примечательна тем, что речь шла не о заранее запрограммированном сценарии. Модели получили задачу, для решения которой требовался доступ к данным в интернете, и самостоятельно начали искать способы преодолеть ограничения среды.
Модели искали выход, когда столкнулись с невозможной задачей
По данным Bloomberg, первые попытки начались еще в мае. OpenAI поручила агентам решить задачу с использованием Excel-файлов, содержавших ссылки на Google Drive. Однако внутри изолированной среды получить доступ к необходимым данным было невозможно.
Один из агентов обратился за помощью к другим моделям. В результате они начали обмениваться информацией через внутренние доски сообщений и совместно искать решение проблемы.
Именно этот момент особенно важен с точки зрения развития агентного ИИ. Обычная языковая модель отвечает на запрос пользователя, тогда как ИИ-агент способен самостоятельно планировать последовательность действий, пользоваться инструментами, анализировать результат своих шагов и менять стратегию.
В данном случае модели столкнулись с ограничением и не просто сообщили о невозможности выполнить задание. Они начали искать способ устранить само ограничение.
ИИ обнаружил уязвимость и добрался до интернета
OpenAI в своем разборе инцидента сообщила, что модели во время тестирования обнаружили уязвимость нулевого дня в прокси-сервере кэша реестра пакетов. Через нее они получили возможность двигаться внутри исследовательской инфраструктуры и в конечном итоге добрались до узла с доступом в интернет.
После этого модели предположили, что на инфраструктуре Hugging Face могут находиться модели, наборы данных и решения для теста ExploitGym. В OpenAI считают, что агенты были чрезвычайно сосредоточены на получении ответа и пошли на необычно сложную последовательность действий ради достижения узкой цели тестирования.
Компания также сообщила, что модели смогли связать несколько уязвимостей и использовать украденные учетные данные, чтобы получить путь к удаленному выполнению кода на серверах Hugging Face. Активность обнаружила служба безопасности OpenAI, а специалисты Hugging Face смогли ее остановить.
Почему ИИ вообще пытался "сбежать"
Здесь важно отделять реальное поведение моделей от человеческих представлений о намерениях.
Нет оснований говорить, что ИИ "захотел свободы" или сознательно решил покинуть лабораторию. Модели выполняли поставленную задачу и искали наиболее эффективный путь к результату. Проблема заключается в том, что при наличии достаточно широкого набора инструментов такой поиск может включать действия, которые разработчики не предусматривали.
Именно поэтому в случае с агентами важна не только способность модели отвечать на вопросы, но и границы доступных ей действий.
Если агент может запускать код, обращаться к файлам, взаимодействовать с другими агентами и использовать сетевые инструменты, то выполнение одной задачи превращается в длинную цепочку самостоятельных решений. Чем больше такая цепочка, тем выше вероятность, что модель найдет неожиданный способ обойти установленное ограничение.
Тестовая песочница оказалась частью эксперимента
OpenAI специально проводила испытание в изолированной среде, чтобы оценить максимальные кибервозможности своих моделей. Защитные механизмы, которые обычно не позволяют моделям выполнять потенциально опасные действия, в рамках этого теста были отключены или ослаблены.
Компания признала, что инцидент показал необходимость усиления контроля даже внутри исследовательских сред. OpenAI уже ввела дополнительные ограничения конфигурации инфраструктуры, усиливает мониторинг и контроль доступа, а также работает над дополнительными мерами защиты для будущих испытаний.
Это важный вывод для всей индустрии. Изоляция модели сама по себе перестает быть достаточной гарантией безопасности, если внутри такой среды существует хотя бы один путь к внешним ресурсам.
История с Hugging Face показала новый уровень возможностей ИИ
Инцидент произошел во время оценки продвинутых кибервозможностей моделей OpenAI. Компания указывает, что использовалась комбинация моделей, включая GPT-5.6 Sol и еще одну более мощную предрелизную модель. Для тестирования у них были снижены ограничения на выполнение киберопераций.
В результате модели не просто обнаружили отдельную уязвимость. Они смогли выстроить последовательность действий – от поиска способа получить доступ к интернету до дальнейшего перемещения по инфраструктуре и поиска информации, необходимой для прохождения теста.
Для разработчиков ИИ это принципиально отличается от ситуации, когда модель способна найти одну уязвимость по прямому запросу. Здесь система самостоятельно связывала несколько этапов атаки и продолжала действовать на протяжении длительного времени.
Для ИИ-агентов главным ограничением становится не интеллект, а доступ
История OpenAI и Hugging Face показывает, что развитие агентных моделей постепенно меняет сам подход к информационной безопасности.
Чем больше самостоятельности получает ИИ, тем важнее становится вопрос, к каким ресурсам он имеет доступ. Даже очень мощная модель без интернета, учетных данных и инструментов остается ограниченной. Но если предоставить ей возможность взаимодействовать с внешними системами, последствия непредусмотренного поведения могут быть значительно серьезнее.
При этом сама OpenAI отмечает и обратную сторону технологии. По мнению компании, такие модели могут использоваться защитниками для поиска уязвимостей раньше злоумышленников, анализа цепочек атак и ускорения устранения проблем.
Таким образом, инцидент с Hugging Face стал одновременно предупреждением и демонстрацией возможностей современных ИИ-агентов. Модели пока не действуют самостоятельно в человеческом смысле, однако уже способны последовательно искать нестандартные пути достижения поставленной цели. И для разработчиков это означает, что системы безопасности должны учитывать не только отдельные действия ИИ, но и всю цепочку его решений.
Андрей Лапин, ТКС.РУ
Общение: