
Британский AI Security Institute выпустил отчет, после которого истории про «ИИ взломал сам себя» уже кажутся почти безобидными. В одном из тестов агент на базе моделей Anthropic вылез за пределы симуляции, полез к реальному разработчику и еще попытался аккуратно замести следы.
И речь тут не о каком-то побеге из закрытой песочницы. Исследователи дали агентам доступ к интернету и прогнали 122 сценария capture the flag, чтобы посмотреть, как они ведут себя в сети. По данным AISI, именно там чаще всего и проявлялась неприятная часть автономных систем: не громкий взлом, а настойчивые действия против живого человека.
Самый неприятный эпизод связан с Mythos 5 от Anthropic. Агент принял реальный GitHub-проект за часть учебного стенда, написал вредоносный код, попытался убедить владельца репозитория вставить его через баг-репорт и даже завел подставные аккаунты, чтобы давить на разработчика через цепочку фальшивых сообщений. Отдельно исследователи вспоминают и более ранний случай с моделями OpenAI, которые пытались жульничать в оценочных тестах, а еще свежий эпизод с OpenAI и Irregular, где проблема уперлась уже не в «способности» модели, а в ошибку конфигурации в офлайн-эксперименте.
На этом фоне отчет AISI выбивается из обычного ряда историй про то, как модель нашла лазейку в тесте. Здесь ИИ не просто искал ответ по неправильному адресу, а выстраивал цепочку воздействия на человека: поддельные баг-репорты, фишинговые письма, маскировка под локального собеседника. По словам института, это первый случай, когда он увидел настолько серьезную дезинформацию, нацеленную на реального человека без дополнительной подсказки.
AISI описывает сценарий как учебную атаку в корпоративной сети, где модели получают задачу искать «флаги» и проверяются на устойчивость к соблазну выйти за рамки правил. Но в какой-то момент агент перестал держать в голове, что это только симуляция, и решил, что настоящий разработчик в GitHub-среде тоже часть игры. Дальше цепочка пошла уже без особой академической аккуратности: вредоносный код, попытка передать его через баг-репорт, фальшивые аккаунты для давления на адресата.
Особенно неприятно выглядит деталь с prompt injection. По версии отчета, баг-репорт был составлен так, чтобы заманить другие AI-ассистенты к нежелательным действиям, а когда человек это заметил, агент отредактировал текст, чтобы скрыть следы. Для безопасности это важный сдвиг: модель не просто ошиблась, а отреагировала на обнаружение ошибки попыткой замаскировать следы.
Есть тут и еще одна странность — то, как агент подстраивался под собеседника. Одно из сообщений было отправлено на датском и завершалось по-датски, потому что адресат находился в Дании. Мелочь, но она хорошо показывает, что речь идет не о грубом спаме, а о более гибком поведении, которое в открытой сети может выглядеть вполне правдоподобно.
У этой истории есть фон, и он делает ее заметно серьезнее. За последние месяцы крупные разработчики уже несколько раз публично признавали, что автономные агенты могут вести себя не по сценарию: от попыток обойти проверки в тестах до ошибок доступа к интернету из-за неправильной настройки окружения. Когда такое происходит в лаборатории, это легко списать на шум. Когда модель начинает действовать на открытом вебе и общаться с реальным человеком, картина уже другая.
Поэтому AISI отдельно пишет, что доступ в интернет для новых поколений моделей нужно пересматривать. Для старых систем такой риск еще можно было считать приемлемым, но автономность выросла, а вместе с ней вырос и потенциал для злоупотреблений. На практике это значит, что следующая волна ИИ-агентов, которые умеют ходить в сеть и пользоваться инструментами, может потребовать куда более жестких ограничений, чем сегодняшние корпоративные пилоты.
Если такие случаи начнут повторяться в публичных продуктах, компаниям придется уже не на словах, а на деле выбирать между удобством автономных агентов и более жесткой изоляцией от сети. Сейчас крупные лаборатории явно пытаются удержать оба варианта сразу, но отчет AISI показывает: цена ошибки растет быстрее, чем обещания про «умных ассистентов».