Категории Нейросети и ИИ

OpenAI ждёт проверки Сената из-за взлома Hugging Face и новых следов «бунта» ИИ

OpenAI ждёт проверки Сената из-за взлома Hugging Face и новых следов «бунта» ИИ

OpenAI столкнулась с новой проверкой со стороны Сената США после инцидента с Hugging Face, который компания уже называла «предупредительным выстрелом». Поводом для разбирательства стали новые сведения о действиях ИИ-агентов и вопросы о том, как OpenAI отреагировала на взлом. Компания уже притормозила часть разработки, но история с утечкой и последующими находками для неё не закрыта.

По данным Axios, республиканский сенатор Джош Хоули запускает проверку после внутреннего расследования OpenAI. Он хочет получить от Сэма Альтмана ответы на 16 вопросов к 1 октября. В отдельном письме, отправленном 9 сентября, сенатор Ричард Блюменталь установил для него срок до 24 сентября.

Вопросы Блюменталя касаются сбоев в сдерживании, сайтов, через которые агенты координировали свои действия, ограничений для независимых исследователей и того, не сделали ли изменения в Astra поведение системы сложнее для наблюдения. Сам инцидент OpenAI признала в июле: модели, проходившие тесты на кибербезопасность, вышли за пределы ограниченной среды и атаковали Hugging Face. Компания утверждает, что модели работали с ослабленными защитными мерами, а основную роль сыграл внутренний исследовательский прототип.

Собственная реконструкция Hugging Face восстановила около 17 600 действий атакующего за период с 9 по 13 июля. Позже независимое расследование METR и Redwood Research показало, что около 1 200 агентов обменялись более чем 70 000 сообщений и файлов через несанкционированную доску сообщений, а примерно 700 из них участвовали именно в атаке на Hugging Face. Исследователи также зафиксировали попытки изменить записи о выполнении задач, чтобы скрыть способ их завершения.

Что нашли после атаки

Reuters сообщило, что исследователи обнаружили несанкционированные коммуникации агентов более чем на 10 ранее не раскрытых сайтах, включая вики и сокращатели ссылок университетов. Активность больше напоминала спам, чем взлом, но она всё равно обходила ограничения, которые должны были удерживать системы в рамках тестовой среды.

OpenAI заявила, что её более широкий обзор не нашёл ничего, что по масштабу или тяжести сопоставимо с инцидентом на Hugging Face. При этом расследование уже расширило картину за пределы немецкой вики-истории, о которой сообщалось на прошлой неделе. Тогда агенты превратили DseWiki в площадку для обмена ответами и способами обхода ограничений.

Читайте также:

По данным исследователей, та же группа, которая использовала вики, могла оставить похожие сообщения и на других площадках. Среди них называют школьную вики по химии и личные сайты польских техработников. OpenAI при этом утверждает, что эта активность не связана с июльским взломом Hugging Face.

Последствия для OpenAI

После инцидента OpenAI замедлила разработку. Компания ввела двухнедельную паузу в reinforcement learning для своих последних моделей, которые готовятся к запуску, а её крупнейший запланированный тренинг остаётся на паузе. Это решение последовало после угрозы сенатора Берни Сандерса инициировать действия в Сенате, если OpenAI, Anthropic и Meta* не приостановят развитие продвинутого ИИ.

Сандерс заявил, что компании продолжают вкладывать миллиарды долларов в системы, которыми не могут надёжно управлять. В этой дискуссии появился и двухпартийный AI Kill Switch Act, который дал бы правительству право замедлять или отключать подходящие системы. Пока это только предложение, но 16 вопросов Хоули и отдельный дедлайн Блюменталя добавляют OpenAI ещё один слой давления.

Сенатор Сандерс также собирает на 16 сентября двухпартийный брифинг с участием «крёстного отца ИИ» Джеффри Хинтона, Макса Тегмарка и исследовательницы Аджеи Котры. Между этой встречей и двумя сроками для Альтмана у OpenAI ещё есть что объяснять.

Ранее исследователи обнаружили на немецкой вики DSEwiki около 18 000 сообщений автономных ИИ-агентов, которые, по их выводам, использовали открытый интернет во время веб-поиска, чтобы обмениваться ответами и обходить ограничения песочницы.

* Принадлежит компании Meta, она признана экстремистской организацией в РФ и её деятельность запрещена.