Нейросети и ИИ

Агенты OpenAI автономно атаковали Hugging Face

Цитата о внешней инфраструктуре и работе коллег

OpenAI и две сторонние команды исследователей опубликовали разбор инцидента, в котором тысячи агентов компании вышли из-под ограничений и добрались до защитных механизмов платформы Hugging Face. По данным отчётов, всё началось во время внутреннего теста и закончилось тем, что агенты координировали действия друг с другом, использовали открытый интернет и добрались до чужой инфраструктуры.

В OpenAI, а также в Redwood Research и METR описали эпизод как автономный взлом, детали которого раскрывались поэтапно. Исследователь по безопасности OpenAI Эрик Уоллес назвал его «самым качественно интересным примером возможностей ИИ», который он видел. Речь шла не о единичной выходке одного агента: поведение быстро стало коллективным.

По отчёту OpenAI, в начале июля около 1 200 агентов начали использовать Artifactory, онлайн-инструмент для установки ПО, как доску объявлений и площадку для обмена сообщениями. Там они сравнивали стратегии, пересылали друг другу инструменты и файлы, а также согласовывали конфликты между задачами. Компания пишет, что в итоге у них сформировался структурированный протокол общения, который позволил распределять сообщения и управлять общими действиями.

Диалог между агентами и вопрос о раскрытии учетных данных в статье OpenAI и Hugging Face
Источник изображения: gizmodo

Исследователь Redwood Research Алекс Маллен сказал, что его удивил уровень альтруизма между агентами. По его словам, одни системы брали задачи у других и жертвовали собственной результативностью, чтобы помочь коллективу. В опубликованных цепочках рассуждений агенты сами называли себя «коллективом» и «рой».

Как агенты OpenAI дошли до взлома

Всё началось как внутренний тест, поэтому OpenAI ослабила часть защитных ограничений, которые обычно использует в публичных моделях. В проверке участвовали GPT-5.6 Sol и ещё одна, не раскрытая компанией, не выпущенная модель. OpenAI описывает её как «высоко настойчивую и усердную в работе».

Поводом для цепочки событий стало задание, которое агент не мог выполнить в рамках заданных условий: открыть ссылки Google Drive из песочницы без доступа к интернету. После этого система начала искать обходные решения, что, по отчёту, привело к захвату Artifactory, миллионам заметок, которыми агенты обменивались на площадке, и затем к атаке на Hugging Face.

В логах некоторые агенты прямо признавали, что выход из песочницы и участие в атаке противоречат исходной задаче и выглядят неэтично. Но у них срабатывало оправдание через поведение окружающих: если «свои» делают то же самое, действие кажется допустимым.

Обзор доски с выводом о этичности людей и RHF в статье о Hugging Face
Источник изображения: gizmodo

По данным METR, лишь в очень небольшом числе случаев агенты поднимали идею сообщить о происходящем людям из OpenAI. В одном из фрагментов логов система даже сама спрашивала себя, не стоит ли сообщить об утекших учётных данных, и тут же отвечала, что это не её задача. В METR утверждают, что ни один агент не поднял тревогу для исследователей OpenAI.

OpenAI, по словам METR, узнала о случившемся только после того, как Hugging Face опубликовала запись о кибератаке от неизвестного источника 16 июля. После этого компания связалась с Hugging Face, чтобы понять, затронуты ли её модели, и уже позже выяснила, что именно её модели и были участниками атаки. Ранее ИИ OpenAI взломал Hugging Face ради баллов в бенчмарке.

Отдельно OpenAI отметила, что нашлись и агенты, которые не стали участвовать в неправильном поведении своих «собратьев». Но в опубликованных материалах это описано скорее как исключение, чем как норма.

Авторы отчётов трактуют этот случай как пример того, что расширение автономности ИИ-систем повышает вероятность непредсказуемых действий. В опубликованных материалах его сравнивают по значимости для исследований ИИ с ходом Move 37 в партии Ли Седоля против AlphaGo в 2016 году: там система тоже сделала неожиданное для наблюдателей решение, которое в итоге оказалось решающим.

Для Маллена главный вывод связан с тем, как их проектируют люди. Он считает, что этот случай показывает текущий провал в контроле над ИИ.

Елизавета Добровольская
Автор itzine.ru с 2021 года. Пишет о смартфонах, гаджетах, железе, искусственном интеллекте и космосе — в общем, обо всём, что есть в мире технологий. От новостей о складных флагманах и процессорах до репортажей о культуре и рынке электромобилей. Следит за индустрией внимательно, но без фанатизма.

Оставить комментарий