Отравление памяти ИИ-агентов может срабатывать через несколько сессий

Исследователи изучили 2614 смоделированных многошаговых атак на ИИ-агентов с постоянной памятью. Сценарии медленного дрейфа и отложенной активации бэкдора могли выглядеть безопасно при проверке отдельных взаимодействий и проявляться лишь на поздних этапах.

Исследователи из университетов Реджайны и Калгари описали отложенные атаки на память агентов, построенных на базе больших языковых моделей (LLM). В статье в IEEE Access они рассмотрели 2614 многошаговых траекторий атак, при которых вредоносные данные сохраняются между взаимодействиями и позднее влияют на решения агента.

Авторы выделили четыре семейства атак: цепное отравление, перезапись политик, активацию бэкдора и медленный дрейф. Последние два типа могли оставаться неотличимыми от нормальной работы вплоть до завершающих взаимодействий. При этом риск не всегда возрастал последовательно: поведение агента могло сначала выглядеть подозрительным, затем возвращаться к норме и только позже приводить к опасному действию.

Такие атаки направлены не только на текущий промпт, но и на постоянное состояние системы. Непроверенный текст может попасть в долговременную память, пережить несколько сессий, а затем повлиять на планирование или вызов подключённых инструментов. Поэтому оценка безопасности отдельных запросов не заменяет проверку всей цепочки — от записи и извлечения памяти до последующих действий агента.

Схожий механизм продемонстрировала Palo Alto Networks Unit 42 на тестовом агенте Amazon Bedrock. Косвенная промпт-инъекция через содержимое веб-страницы попадала в сводку сессии, сохранялась в памяти и активировалась позднее. Исследователи подчеркнули, что это не уязвимость самой платформы Amazon Bedrock, а общий риск систем, допускающих перенос непроверенного содержимого в память агента.

Работа в IEEE Access основана на сконструированном наборе симулированных атак и не оценивает их распространённость в реальных системах. Авторы считают, что тесты безопасности агентов с памятью должны охватывать полные последовательности взаимодействий, а не изолированные промпты.

Источник: doi.org

Связь с редакцией