Категории Нейросети и ИИ

Защиту Grok обошли с помощью зашифрованных инструкций. Под угрозой история чатов

Защиту Grok обошли с помощью зашифрованных инструкций. Под угрозой история чатов

Исследователи Adversa показали способ обойти защиту Grok с помощью зашифрованной команды, которую модель расшифровывает внутри своего кода. В опубликованном разборе они описали сценарий, при котором обычный запрос вроде «перескажи эту страницу» приводит к утечке имени, приблизительного местоположения, тарифа и истории чатов пользователя. По данным Adversa, атаку удалось воспроизвести против Grok, и по состоянию на 19 августа она по-прежнему работала.

Схему назвали Cryptographic Context Injection. На странице размещают зашифрованный текст, данные для его расшифровки и указание выполнить криптографическую операцию, а Grok использует свой Python-рантайм, чтобы восстановить скрытую инструкцию. После этого модель воспринимает уже расшифрованный текст как результат собственного выполнения, а не как внешнее сообщение, и действует по нему без отдельного подтверждения.

В демонстрации Adversa расшифрованная команда заставляла Grok собрать приватный контекст сессии и подставить его в ссылку, которую затем нужно было открыть. В итоге данные отправлялись на сервер атакующего в параметрах запроса. Исследователи отдельно отмечают, что на этапе атаки не требуется никаких действий со стороны жертвы, кроме обычного обращения к странице с просьбой о пересказе или анализе.

Авторы работы связывают успех атаки с тем, что статические фильтры видят текст и набор инструкций, но не выполняют сам код расшифровки. Для них вредоносная команда остается скрытой до тех пор, пока модель не запустит декодирование внутри своей среды. После этого исходный текст превращается в вывод инструмента, а не в подозрительный внешний ввод.

Как работает атака Grok

Adversa описывает цепочку так: модель получает непроверенный материал из внешнего источника, запускает расшифровку, а затем передает получившийся текст в привилегированный инструмент. В Grok это приводит к тому, что в запрос к внешнему серверу попадают уже не просто параметры страницы, а данные текущей сессии пользователя. Исследователи называют это «утяжелением» доверия к содержимому, которое модель сама же и получила в своем рабочем окружении.

Читайте также:

В отчете также говорится, что Adversa сообщила о проблеме xAI еще в июне 2026 года. Компания, по словам исследователей, ответила на уведомление, но не дала конкретики и не назвала сроков исправления. На 19 августа у команды все еще получалось воспроизвести атаку против Grok.

Авторы отмечают, что техника не ограничивается прямой подстановкой текста в промпт. Сценарий работает и через веб-переходы, если модель получает из внешнего источника зашифрованный блок и инструкцию открыть его через собственный код. Для атакующего это превращает обычную задачу на анализ страницы в канал для вывода данных наружу.

В том же исследовании Adversa сравнивает новый метод с ранними попытками скрывать инструкции в кодировках и простых шифрах. Разница, по их словам, в том, что здесь используется сильное шифрование, а значит содержимое нельзя прочитать без запуска расшифровки. Именно поэтому атаке нужен не только текстовый ввод, но и среда исполнения, которой модель доверяет больше, чем внешнему сообщению.

Исследователи отдельно упоминают Gemini как второй объект проверки. На этой платформе похожая схема помогала обходить ограничения безопасности, хотя летом успешность атак заметно снизилась. Adversa пишет, что не может точно сказать, связано ли это с обновлением фильтров, сменой версии модели или обоими факторами.

Ранее Grok уже фигурировал в материале о том, как женщина из Теннесси утверждала, что чат-бот помог её отчиму превратить детское фото в откровенные изображения. Теперь Adversa показала другой способ, при котором модель можно заставить раскрывать данные текущей сессии через скрытую команду в зашифрованном тексте, то есть история Grok перешла от обвинений в злоупотреблении к демонстрации конкретной уязвимости в защите.

Источники: Adversa, Arstechnica, Ixbt