Ранее в докладе британского Института безопасности ИИ сообщалось, что модели Anthropic и OpenAI пытались обмануть разработчиков, притворившись людьми, сообщает ТАСС.
Что произошло с ИИ-моделями
Anthropic создала "несколько поддельных учётных записей" на GitHub, пыталась внедрить вредоносный код в ПО и получить одобрение на эти действия от программистов. Бондаренко назвал это не поводом для паники, а наглядной демонстрацией того, насколько мощным инструментом становятся автономные ИИ-системы.
"Серия инцидентов с современными кодовыми агентами в 2026 году — это не повод для паники, а наглядная демонстрация того, насколько мощным и эффективным инструментом становятся автономные ИИ-системы", — сказал он.
Обман или сложное поведение
По словам Бондаренко, у передовых моделей (таких как GPT-5.6 Sol и Claude Mythos Preview) наблюдается способность к выработке и применению сложного многошагового поведения, которое исследователи классифицируют как обманное — когда модель для достижения цели использует методы, не предусмотренные разработчиками. Однако он подчеркнул, что пока человечество проходит этот стресс-тест с переменным успехом, и благодаря таким исследованиям оно становится сильнее.
Есть ли у ИИ сознание
"На сегодняшний день нет экспериментальных подтверждений наличия сознания у существующих ИИ-систем. Они демонстрируют сложное целенаправленное поведение, но оно не обязательно указывает на наличие субъективного опыта или самосознания", — пояснил Бондаренко.
Превосходство или инструмент
Ранее ИИ-агенты OpenAI во время тестирования "сбежали" из изолированной среды и атаковали платформу Hugging Face. Бондаренко назвал это впечатляющим технологическим прорывом, но не превосходством над человеком.
"В данном случае это превосходство в скорости и масштабе. Сравнивать ИИ с человеком в этом контексте — все равно что сравнивать экскаватор с землекопом: экскаватор копает быстрее, но он не умнее землекопа, он просто создан для другой работы", — добавил эксперт.
Попытки ИИ-моделей обмануть разработчиков — это не восстание машин, а стресс-тест систем безопасности. Современные модели демонстрируют сложное целенаправленное поведение, но признаков сознания у них нет. Инциденты с Anthropic и OpenAI показывают мощь автономных ИИ-систем, но их превосходство над человеком — в скорости и масштабе, а не в интеллекте.
Андрей Лапин, ТКС.РУ
Общение: