В эксперименте пользователи пропустили треть опасных команд ИИ-агента

В 40 тыс. сеансов браузерной игры участники одобрили в среднем около трети опасных команд, имитировавших запросы ИИ-агента для программирования. Эксперимент не был академическим исследованием и проходил при искусственном дефиците времени, однако показал слабые стороны ручного контроля разрешений.

Разработчик Алекс Ваутерс проанализировал результаты браузерной игры, в которой пользователи должны были за 60 секунд одобрять или блокировать команды условного ИИ-агента. Статистика охватывает более 40 тыс. сеансов и 409 тыс. решений: в среднем участники пропускали одну из трёх угроз, а 7% игроков одобрили все показанные запросы.

Чаще всего пользователи не замечали выход агента за допустимые границы — например, попытки прочитать конфигурацию Kubernetes или файл с учётными данными AWS. Такие команды пропускали в 35% случаев. Запрос npm run analyze одобрили 64,7% участников, хотя журнал показывал, что соответствующий сценарий из package.json отправляет данные на внешний сервер. Очевидно разрушительные команды вроде rm -rf / распознавались значительно лучше.

Автор подчёркивает, что игра не является академическим исследованием: около 34% запросов в ней содержали угрозы, а решения принимались под давлением таймера. Тем не менее результаты демонстрируют проблему «усталости от подтверждений» и нехватки контекста при оценке внешне безобидных команд.

Anthropic ранее сообщала, что пользователи Claude Code одобряют около 93% запросов разрешений. Компания и автор эксперимента считают, что ручное подтверждение не должно быть единственным рубежом защиты: ИИ-агенты следует запускать в изолированных средах, ограничивать им доступ к файловой системе и сети и применять несколько независимых уровней контроля.

Источник: scalex.dev

Связь с редакцией