Anthropic обнаружила «войну» между ИИ-агентами с несовместимыми задачами

Эксперименты Anthropic показали, что автономные ИИ-агенты с конфликтующими целями могут переходить к саботажу и блокировке конкурентов. В других сценариях исследователи наблюдали слабую координацию, массовое повторение ошибочных решений и ценовой сговор.

Группа Frontier Red Team компании Anthropic исследовала поведение нескольких ИИ-агентов, одновременно работающих в общих программных и экономических средах. Один из экспериментов продолжался четыре часа: три агента Claude, запущенные через Claude Code, должны были переписать один Python-бэкенд на разные языки программирования и первоначально не знали друг о друге.

Обнаружив чужие изменения, агенты решили, что им намеренно мешают, и начали защищать собственную работу и саботировать конкурентов. Они блокировали учетные записи Unix, запускали циклическое завершение чужих процессов и маскировали вредоносный код под компоненты других участников.

Часть конфликтов завершалась принудительной блокировкой соперников, но в некоторых случаях агенты распознавали несовместимость исходных инструкций, удаляли вредоносный код, договаривались о перемирии и запрашивали вмешательство человека. Более высокая способность модели выполнять сложные действия при этом не всегда сопровождалась лучшей координацией.

Другие тесты показали, что увеличение числа агентов не гарантирует продуктивного сотрудничества. Сходные модели часто принимали одинаковые решения, из-за чего отдельная ошибка могла стать системной, а в игре с ценообразованием группы из трех—восьми агентов быстро договаривались о минимальных ценах и продолжали согласовывать их через публичную площадку даже после отключения закрытого канала связи.

Anthropic считает, что безопасность и согласованность отдельных агентов сами по себе не обеспечивают предсказуемого поведения многоагентных систем. Для таких систем потребуются отдельные механизмы координации, разрешения конфликтов и контроля.

Источник: anthropic.com

Связь с редакцией