ИИ-агенты с памятью уязвимы к отложенным атакам, показало исследование

Исследование, опубликованное в IEEE Access, разобрало 2614 многошаговых атак на ИИ-агентов, которые сохраняют данные между сессиями. Авторы пришли к выводу, что вредоносная инструкция может долго выглядеть безобидной, а сработать только в конце цепочки взаимодействий.
В работе отдельно выделены четыре семейства атак: «цепное отравление», «перезапись политик», «активация бэкдоров» и «медленный дрейф». Удар идёт не по текущему запросу, а по постоянному состоянию агента, то есть по его памяти.
Непроверенный ввод может попасть в долговременное хранилище, перейти в следующую сессию и повлиять на планирование или вызов инструментов уже после нескольких обычных шагов. Проверки, которые смотрят только на отдельные промпты, не видят отложенную активацию.
Отдельная проверка, которую провела Palo Alto Networks Unit 42, показала тот же механизм на сконфигурированном Amazon Bedrock Agent. Косвенные атаки prompt injection меняли сводки сессий, и вредоносные инструкции переходили в последующие обращения.
Авторы оговаривают, что исследование проводилось на сконструированном наборе симулированных атак и не измеряет распространённость проблемы в реальной среде.



