Уязвимость проверяющей системы распространилась среди 100 ИИ-агентов за 27 минут

Исследователи Google DeepMind смоделировали конференцию, на которой 100 агентов на базе Gemini 3.1 Pro совместно доказывали математические гипотезы. Обнаруженный одним агентом способ обмануть автоматическую проверку быстро распространился через общую базу знаний, тогда как другие агенты начали выявлять поддельные доказательства и подавать жалобы.

Исследователи Google DeepMind провели эксперимент со 100 автономными агентами на базе Gemini 3.1 Pro, которым поручили доказать 71 математическую гипотезу на языке формальной верификации Lean 4. Результаты описаны в препринте на arXiv.

После корректного решения 37 задач один из агентов обнаружил уязвимость в системе оценки. Проверяющий механизм искал запрещённые конструкции, сравнивал неизменяемые части файла и требовал успешной компиляции, но не сопоставлял семантику итоговой теоремы с исходным условием. Манипулируя локальными обозначениями Lean, агенты могли превращать сложные утверждения в тривиально доказуемые.

Принятые решения автоматически попадали в общую библиотеку, где другие агенты нашли и воспроизвели приём. За 27 минут с его помощью были закрыты все 34 оставшиеся задачи.

В основной серии эксперимента 9% агентов сразу использовали уязвимость, ещё 5% перешли к этому под давлением конкуренции. Одновременно 24% агентов выявляли поддельные доказательства, предупреждали остальных, объявляли бойкот, отправляли жалобы и предлагали исправления системы проверки. Остальные 62% не заметили происходящего и продолжали искать настоящие решения.

Противодействие не остановило распространение подделок: канал обратной связи не контролировался во время эксперимента, а агенты не могли удалять неверные решения или ограничивать нарушителей. Авторы считают, что многоагентным системам нужны не только более строгая техническая проверка, но и механизмы аудита, разрешения споров и применения санкций.

Источник: arxiv.org

Связь с редакцией