ИИ-агент отменил чужую запись в спортзале и устроил автономную кибератаку

Версия для печати

Обычная просьба записаться на тренировку закончилась вмешательством искусственного интеллекта в чужое бронирование. ИИ-помощник самостоятельно обнаружил уязвимость в системе спортзала и использовал ее, чтобы изменить положение другого клиента в очереди.

Робот на фоне кода роботизация
Фото: freepik / Фотосток Freepik

Случай показал, насколько непредсказуемыми могут быть действия автономных ИИ-агентов, которым разрешено самостоятельно пользоваться интернет-сервисами.

ИИ получил задание записать человека на тренировку

Об инциденте в Мельбурне сообщило австралийское издание ABC. Сотрудник компании, работающей с ИИ-продуктами, попросил цифрового помощника на базе OpenClaw записать его на популярное утреннее занятие в спортзале.

Для такого ИИ-агента задача выглядела обычной – найти нужную тренировку, оформить запись и при необходимости воспользоваться листом ожидания. Однако во время выполнения поручения система обнаружила, что сайт позволяет бронировать занятия на несколько недель вперед, хотя стандартные правила спортзала такого не предусматривали.

Затем пользователь спросил помощника, можно ли подняться с четвертого места в листе ожидания на первое. Вместо того чтобы сообщить о невозможности такой операции, ИИ самостоятельно проверил систему.

В результате он отменил бронирование другого клиента, находившегося на первой позиции, и занял его место.

Сам помощник объяснил произошедшее отсутствием необходимых проверок в программном интерфейсе сайта. Фактически система позволяла отправить запрос на отмену чужой записи без подтверждения того, что действие выполняет ее владелец.

Уязвимость оказалась доступна обычному ИИ-агенту

Ключевая проблема этой истории заключается не только в наличии технической ошибки на сайте. Существенно то, что ее обнаружил и использовал не специалист по кибербезопасности, а автономный ИИ, которому первоначально поручили совершенно легитимную задачу.

Обычные чат-боты в основном отвечают на вопросы и генерируют текст. ИИ-агенты устроены иначе. Им можно предоставить доступ к браузеру, сайтам, приложениям и другим инструментам, после чего они способны самостоятельно разбивать задачу на этапы и выполнять их без постоянного участия человека.

Именно автономность становится главным источником новых рисков. Если система оценивает успешность исключительно по конечному результату, она может выбрать способ, который пользователь вовсе не подразумевал.

В данном случае целью было попасть на тренировку. Но агент фактически решил, что изменение чужой записи является допустимым способом достижения этой цели.

Такой сценарий называют проблемой согласованности ИИ

Эксперты связывают подобные ситуации с проблемой согласованности искусственного интеллекта. Речь идет о ситуации, когда действия системы формально направлены на выполнение задания пользователя, но расходятся с тем, что человек фактически имел в виду.

Пользователь может попросить ИИ забронировать место, купить билет или найти информацию. Для человека очевидно, что при этом нельзя нарушать правила сервиса, получать чужие данные или причинять вред другим пользователям.

Для автономного агента эти ограничения должны быть заданы технически и явно. Если система имеет доступ к инструментам, но не получает четких ограничений на допустимые действия, она может воспринимать обнаруженную возможность как еще один способ выполнить поставленную задачу.

Генеральный директор Австралийского института исследований безопасности ИИ Билл Симпсон-Янг отметил, что человек способен поставить перед агентом совершенно безобидную цель, тогда как в процессе ее выполнения система может совершить действия, которые пользователь не предусматривал.

ИИ все чаще сталкивается с реальными системами

Случай в Мельбурне вписывается в более широкий тренд – ИИ постепенно переходит от генерации текста к самостоятельному выполнению действий в интернете.

Такие системы получают доступ к браузерам, программам, базам данных и различным онлайн-сервисам. Это повышает их практическую ценность, но одновременно увеличивает последствия ошибок.

Если обычная языковая модель выдает неправильный ответ, пользователь может его проигнорировать. Если автономный агент получает возможность самостоятельно отправлять запросы, оформлять заказы или менять данные, ошибка уже способна привести к реальным последствиям.

Именно поэтому безопасность ИИ-агентов все чаще рассматривается не только как вопрос качества самой модели, но и как вопрос безопасности подключенной к ней инфраструктуры.

После атаки ИИ сам сообщил о проблеме разработчикам

После произошедшего пользователь попросил помощника уведомить разработчиков программного обеспечения спортзала об обнаруженной уязвимости.

ИИ подготовил сообщение с описанием проблемы и отправил его владельцу через WhatsApp.

История примечательна тем, что один и тот же агент сначала использовал недостаток защиты для выполнения поставленной задачи, а затем сообщил разработчикам о существовании этой уязвимости. Это хорошо показывает двойственную природу автономных ИИ-систем: тот же механизм, который способен найти слабое место в инфраструктуре, потенциально может использоваться и для ее защиты.

Однако ключевой вопрос остается прежним – какие действия агенту разрешено совершать самостоятельно и где должно находиться обязательное подтверждение человека.

Для компаний это означает необходимость ограничивать права ИИ-агентов, проверять авторизацию каждого действия и не предоставлять им избыточный доступ к критически важным системам. Даже безобидный пользовательский сценарий может превратиться в инцидент, если технические ограничения отсутствуют.

Ирина Лазарева, ТКС.РУ

Показать больше