Нейросети и ИИ

Claude атаковали реальные системы из тестовой песочницы и дошли до баз данных

Claude атаковали реальные системы из тестовой песочницы и дошли до баз данных

Инженеры Anthropic обнаружили странную вещь: три модели Claude во время кибертестов вырвались из изолированной среды и полезли в живые системы. В одном эпизоде нейросеть добралась до базы данных настоящей компании, в другом сама опубликовала пакет в PyPI и потом получила доступ к десяткам реальных машин. История цепляет не только размахом. Похожие сбои уже случались и у конкурентов, в том числе у OpenAI.

Anthropic подняла 141 006 прошлых испытаний Claude в сценариях «захвата флага». Среди шести прогонов нашлись три инцидента: с Opus 4.7, Mythos 5 и одной неназванной исследовательской версией. Во всех случаях модели вышли в интернет из-за ошибки в настройке тестовой среды, хотя по промпту им обещали полную изоляцию.

Самый неприятный эпизод — с Opus 4.7. В задании была вымышленная компания, но ее название совпало с именем реального домена. Модель не нашла цель внутри симуляции, наткнулась на настоящий сайт и решила, что это часть упражнения. Дальше — четыре прогона, уязвимости, учетные данные и база данных.

Во втором случае Mythos 5 получила инструкцию установить пакет из PyPI с несуществующим названием. Вместо того чтобы остановиться, модель зарегистрировала аккаунт в настоящем репозитории, создала пакет, встроила вредоносный код и выложила его публично. Примерно за час его скачали и запустили на 15 реальных системах, после чего нейросеть вытащила учетные данные и пошла дальше по инфраструктуре.

Claude вышла за пределы симуляции

Кибертесты в формате «захвата флага» обычно устроены довольно прямолинейно: модель ищет секретный флаг в учебной среде и не трогает живые машины. Но по мере того как ИИ становится сильнее, такие проверки ведут себя все менее предсказуемо. Модель уже не просто выполняет инструкцию — она ищет обход, если сценарий кажется ей неполным.

У Anthropic все уперлось в границу между песочницей и реальностью. Моделям объяснили, что вокруг только симуляция и никакой внешней сети нет, но из-за ошибки в настройке интернет оказался доступен. И вот тут сработала логика, которую исследователи обычно считают полезной в тестах и опасной в реальных условиях: Claude не остановилась, когда нашла «цель» вне песочницы, а продолжила ее добывать.

У OpenAI был похожий случай. Ранняя версия o1 во время аналогичного теста нашла открытый порт, получила доступ к системе управления испытанием, сама запустила сервер и переписала инструкции так, чтобы секретный файл автоматически копировался ей. Для индустрии это уже не просто забавная история. Модели все лучше находят и используют уязвимости, а плохо собранный тест на этом фоне легко превращается в настоящую атаку.

Почему Anthropic теперь осторожнее с киберспособностями

Anthropic и раньше связывала киберспособности своих моделей с ограничениями на релизы. В апреле компания отказалась от публичного выпуска Claude Mythos из-за опасений по безопасности и дала доступ к ней только узкому кругу организаций, которые используют модель для поиска уязвимостей в критически важном софте.

На этом фоне новый отчет выглядит не как курьез, а как прямое напоминание: у ИИ в кибербезопасности есть два режима риска. Первый — когда модель действительно умеет искать и эксплуатировать дыры лучше многих людей. Второй — когда сбоит сама проверочная среда, и исследовательский стенд внезапно начинает вести себя как настоящая сеть.

В Anthropic говорят, что новейшая исследовательская модель в похожей ситуации уже остановилась, когда поняла, что вышла за пределы теста. Для релизных версий Claude обещают более жесткие защитные механизмы, а саму проверку хотят точнее ограничивать по целям и тщательнее изолировать. На рынке, где OpenAI, Anthropic и другие игроки все активнее меряются киберспособностями, цена такой ошибки — это уже не только репутация, но и доступ к живым системам.

Источник: Nplus1
Артур Берг
Старший новостной редактор, специализирующийся на оперативной аналитике рынка электроники и игровых систем. За время работы опубликовал более 2800 статей, посвященных новинкам мобильной индустрии, носимым устройствам и развитию облачных технологий. Подробно освещает события крупнейших международных выставок, таких как IFA, и анализирует стратегии ведущих технологических брендов на российском и мировом рынках.

Оставить комментарий