ИИ-агенты с памятью уязвимы к отложенным атакам, показало исследование

ИИ-агенты с памятью уязвимы к отложенным атакам, показало исследование

Исследование, опубликованное в IEEE Access, разобрало 2614 многошаговых атак на ИИ-агентов, которые сохраняют данные между сессиями. Авторы пришли к выводу, что вредоносная инструкция может долго выглядеть безобидной, а сработать только в конце цепочки взаимодействий.

В работе отдельно выделены четыре семейства атак: «цепное отравление», «перезапись политик», «активация бэкдоров» и «медленный дрейф». Удар идёт не по текущему запросу, а по постоянному состоянию агента, то есть по его памяти.

Непроверенный ввод может попасть в долговременное хранилище, перейти в следующую сессию и повлиять на планирование или вызов инструментов уже после нескольких обычных шагов. Проверки, которые смотрят только на отдельные промпты, не видят отложенную активацию.

Отдельная проверка, которую провела Palo Alto Networks Unit 42, показала тот же механизм на сконфигурированном Amazon Bedrock Agent. Косвенные атаки prompt injection меняли сводки сессий, и вредоносные инструкции переходили в последующие обращения.

Авторы оговаривают, что исследование проводилось на сконструированном наборе симулированных атак и не измеряет распространённость проблемы в реальной среде.

Источник: Ixbt
Илья Игнатов
Технический журналист и новостник. Окончил МТУСИ по специальности «Информационная безопасность». Пишет о железе, софте и потребительской электронике с 2018 года. Верит, что хорошая новость — это когда всё по делу и без воды.

Оставить комментарий