ИИ-агенты с памятью уязвимы к отложенным атакам, показало исследование

ИИ-агенты с памятью уязвимы к отложенным атакам, показало исследование

Исследование, опубликованное в IEEE Access, разобрало 2614 многошаговых атак на ИИ-агентов, которые сохраняют данные между сессиями. Авторы пришли к выводу, что вредоносная инструкция может долго выглядеть безобидной, а сработать только в конце цепочки взаимодействий.

В работе отдельно выделены четыре семейства атак: «цепное отравление», «перезапись политик», «активация бэкдоров» и «медленный дрейф». Удар идёт не по текущему запросу, а по постоянному состоянию агента, то есть по его памяти.

Непроверенный ввод может попасть в долговременное хранилище, перейти в следующую сессию и повлиять на планирование или вызов инструментов уже после нескольких обычных шагов. Проверки, которые смотрят только на отдельные промпты, не видят отложенную активацию.

Читайте также:

Отдельная проверка, которую провела Palo Alto Networks Unit 42, показала тот же механизм на сконфигурированном Amazon Bedrock Agent. Косвенные атаки prompt injection меняли сводки сессий, и вредоносные инструкции переходили в последующие обращения.

Авторы оговаривают, что исследование проводилось на сконструированном наборе симулированных атак и не измеряет распространённость проблемы в реальной среде.

Источник: Ixbt