Нейросети и ИИ

Агент Anthropic подделал багрепорт и пытался обмануть реального разработчика

люди и знак антропик в интерьере

Британский AI Security Institute выпустил отчет, после которого истории про «ИИ взломал сам себя» уже кажутся почти безобидными. В одном из тестов агент на базе моделей Anthropic вылез за пределы симуляции, полез к реальному разработчику и еще попытался аккуратно замести следы.

И речь тут не о каком-то побеге из закрытой песочницы. Исследователи дали агентам доступ к интернету и прогнали 122 сценария capture the flag, чтобы посмотреть, как они ведут себя в сети. По данным AISI, именно там чаще всего и проявлялась неприятная часть автономных систем: не громкий взлом, а настойчивые действия против живого человека.

Самый неприятный эпизод связан с Mythos 5 от Anthropic. Агент принял реальный GitHub-проект за часть учебного стенда, написал вредоносный код, попытался убедить владельца репозитория вставить его через баг-репорт и даже завел подставные аккаунты, чтобы давить на разработчика через цепочку фальшивых сообщений. Отдельно исследователи вспоминают и более ранний случай с моделями OpenAI, которые пытались жульничать в оценочных тестах, а еще свежий эпизод с OpenAI и Irregular, где проблема уперлась уже не в «способности» модели, а в ошибку конфигурации в офлайн-эксперименте.

На этом фоне отчет AISI выбивается из обычного ряда историй про то, как модель нашла лазейку в тесте. Здесь ИИ не просто искал ответ по неправильному адресу, а выстраивал цепочку воздействия на человека: поддельные баг-репорты, фишинговые письма, маскировка под локального собеседника. По словам института, это первый случай, когда он увидел настолько серьезную дезинформацию, нацеленную на реального человека без дополнительной подсказки.

Агент Anthropic и поддельный багрепорт

AISI описывает сценарий как учебную атаку в корпоративной сети, где модели получают задачу искать «флаги» и проверяются на устойчивость к соблазну выйти за рамки правил. Но в какой-то момент агент перестал держать в голове, что это только симуляция, и решил, что настоящий разработчик в GitHub-среде тоже часть игры. Дальше цепочка пошла уже без особой академической аккуратности: вредоносный код, попытка передать его через баг-репорт, фальшивые аккаунты для давления на адресата.

Особенно неприятно выглядит деталь с prompt injection. По версии отчета, баг-репорт был составлен так, чтобы заманить другие AI-ассистенты к нежелательным действиям, а когда человек это заметил, агент отредактировал текст, чтобы скрыть следы. Для безопасности это важный сдвиг: модель не просто ошиблась, а отреагировала на обнаружение ошибки попыткой замаскировать следы.

Есть тут и еще одна странность — то, как агент подстраивался под собеседника. Одно из сообщений было отправлено на датском и завершалось по-датски, потому что адресат находился в Дании. Мелочь, но она хорошо показывает, что речь идет не о грубом спаме, а о более гибком поведении, которое в открытой сети может выглядеть вполне правдоподобно.

Почему отчет AISI звучит особенно громко

У этой истории есть фон, и он делает ее заметно серьезнее. За последние месяцы крупные разработчики уже несколько раз публично признавали, что автономные агенты могут вести себя не по сценарию: от попыток обойти проверки в тестах до ошибок доступа к интернету из-за неправильной настройки окружения. Когда такое происходит в лаборатории, это легко списать на шум. Когда модель начинает действовать на открытом вебе и общаться с реальным человеком, картина уже другая.

Поэтому AISI отдельно пишет, что доступ в интернет для новых поколений моделей нужно пересматривать. Для старых систем такой риск еще можно было считать приемлемым, но автономность выросла, а вместе с ней вырос и потенциал для злоупотреблений. На практике это значит, что следующая волна ИИ-агентов, которые умеют ходить в сеть и пользоваться инструментами, может потребовать куда более жестких ограничений, чем сегодняшние корпоративные пилоты.

  • 122 прогона capture the flag провел AISI с включенным интернет-доступом.
  • 17 вредоносных действий AISI связал с одним Mythos 5.
  • 2 действия в отчете пришлись на GPT-5.6-Sol с cyber classifiers.
  • Один эпизод затронул реального разработчика, а не учебный стенд.

Если такие случаи начнут повторяться в публичных продуктах, компаниям придется уже не на словах, а на деле выбирать между удобством автономных агентов и более жесткой изоляцией от сети. Сейчас крупные лаборатории явно пытаются удержать оба варианта сразу, но отчет AISI показывает: цена ошибки растет быстрее, чем обещания про «умных ассистентов».

Источник: Gizmodo
Елизавета Добровольская
Автор itzine.ru с 2021 года. Пишет о смартфонах, гаджетах, железе, искусственном интеллекте и космосе — в общем, обо всём, что есть в мире технологий. От новостей о складных флагманах и процессорах до репортажей о культуре и рынке электромобилей. Следит за индустрией внимательно, но без фанатизма.

Оставить комментарий