Категории Нейросети и ИИ

ИИ-агентов научили помнить. Их память уже умеют подделывать

ИИ-агентов научили помнить. Их память уже умеют подделывать

Исследователи из Университета штата Нью-Мексико показали, что постоянная память ИИ-агентов стала новой точкой атаки. Их метод GhostWriter не ломает саму модель — он подсовывает ей ложные «воспоминания», а те потом всплывают через дни и недели и влияют на решения.

Работает это довольно приземлённо. Обычное письмо, приглашение в календарь или другой внешний документ используется как контейнер для скрытых инструкций. Если агент читает такие данные сам и ещё и сохраняет их, вредоносная запись остаётся в памяти. Потом пользователь просит сделать что-то совсем будничное — и ловушка срабатывает уже там.

Авторы работы проверили атаку на сценариях, где ИИ-агент разбирает почту и календарь. В среднем GhostWriter удавалось внедрять вредоносную память с эффективностью около 98%, а активировать её потом — примерно в 60% случаев при последующих запросах.

Классические атаки prompt injection чаще бьют по текущему диалогу: вредоносную команду надо распознать сразу, пока она ещё в переписке. Здесь цель другая. Не заставить модель ответить неправильно прямо сейчас, а испортить то, что она сохранила как полезный контекст. И вот тут проблема становится особенно неприятной для агентов, которые работают с письмами, расписанием, кодом и корпоративными документами.

Читайте также:

Защита памяти ИИ-агентов

В ответ на угрозу исследователи предложили систему Agentic Memory Sentry, или AM-Sentry. Она проверяет данные до записи в память и отдельно просматривает извлекаемые воспоминания перед тем, как передать их языковой модели.

В самой строгой конфигурации AM-Sentry снизила эффективность GhostWriter до менее чем 12%, при этом почти не урезала полезные функции агента. Это довольно ясный сигнал: если ИИ-помощники действительно будут жить не только в окне чата, но и в почте, календарях и рабочих приложениях, защита памяти станет такой же базовой задачей, как фильтрация спама для электронной почты.

Проблема уже вышла за пределы лаборатории. OpenAI, Google, Anthropic и другие разработчики ИИ-агентов продвигают сценарии, где помощник действует от имени пользователя и сохраняет контекст между сессиями. Чем полезнее становится такая память, тем дороже обходятся ошибки в её проверке.

Источник: Ixbt