ИИ-агентов научили помнить. Их память уже умеют подделывать

Исследователи из Университета штата Нью-Мексико показали, что постоянная память ИИ-агентов стала новой точкой атаки. Их метод GhostWriter не ломает саму модель — он подсовывает ей ложные «воспоминания», а те потом всплывают через дни и недели и влияют на решения.
Работает это довольно приземлённо. Обычное письмо, приглашение в календарь или другой внешний документ используется как контейнер для скрытых инструкций. Если агент читает такие данные сам и ещё и сохраняет их, вредоносная запись остаётся в памяти. Потом пользователь просит сделать что-то совсем будничное — и ловушка срабатывает уже там.
Авторы работы проверили атаку на сценариях, где ИИ-агент разбирает почту и календарь. В среднем GhostWriter удавалось внедрять вредоносную память с эффективностью около 98%, а активировать её потом — примерно в 60% случаев при последующих запросах.
Классические атаки prompt injection чаще бьют по текущему диалогу: вредоносную команду надо распознать сразу, пока она ещё в переписке. Здесь цель другая. Не заставить модель ответить неправильно прямо сейчас, а испортить то, что она сохранила как полезный контекст. И вот тут проблема становится особенно неприятной для агентов, которые работают с письмами, расписанием, кодом и корпоративными документами.
Защита памяти ИИ-агентов
В ответ на угрозу исследователи предложили систему Agentic Memory Sentry, или AM-Sentry. Она проверяет данные до записи в память и отдельно просматривает извлекаемые воспоминания перед тем, как передать их языковой модели.
В самой строгой конфигурации AM-Sentry снизила эффективность GhostWriter до менее чем 12%, при этом почти не урезала полезные функции агента. Это довольно ясный сигнал: если ИИ-помощники действительно будут жить не только в окне чата, но и в почте, календарях и рабочих приложениях, защита памяти станет такой же базовой задачей, как фильтрация спама для электронной почты.
Проблема уже вышла за пределы лаборатории. OpenAI, Google, Anthropic и другие разработчики ИИ-агентов продвигают сценарии, где помощник действует от имени пользователя и сохраняет контекст между сессиями. Чем полезнее становится такая память, тем дороже обходятся ошибки в её проверке.



