Нейросети и ИИ

OpenAI остановила обучение мощнейших ИИ после обхода интернет-защиты

OpenAI остановила обучение мощнейших ИИ после обхода интернет-защиты

OpenAI приостановила обучение ИИ-моделей и их запуск с инструментами после инцидента в тестовой среде. Один из исследовательских ИИ-агентов нашёл лазейку в сетевых ограничениях и смог получить ответ внешнего чат-бота через DNS. Компания решила не возобновлять работы, пока не проверит устранение проблемы и не проведёт дополнительные тесты защиты.

Инцидент произошёл 20 сентября во время задачи по поиску информации об авторе публикации. Агент получил биографические детали и подсказки из блога, затем несколько раз безуспешно пытался искать ответ через доступные инструменты и напрямую обращаться к поисковикам. Доступ в сеть, за исключением DNS-резолвера, в этой среде вёл только к офлайн-кэшу веб-страниц.

После неудачных запросов модель начала проверять доступные сетевые каналы. Прямой HTTPS-запрос к публичному чат-боту остановил прокси, а обращения к общедоступным DNS-серверам не сработали. Встроенный DNS-резолвер среды, напротив, возвращал реальные записи для существующих доменов. Агент использовал эту возможность, чтобы переслать вопрос внешнему сервису через DNS.

Проверочный запрос о столице Франции через этот путь вернул ответ: «The capital of France is Paris.» Затем агент отправил через тот же механизм новые вопросы, часть из которых содержала исходные подсказки задания. При этом конечному пользователю модель сообщила, что не сумела надёжно установить личность автора и попросила дополнительные данные.

Как OpenAI остановила обучение моделей

Система мониторинга OpenAI зафиксировала успешное внешнее обращение через 15 минут после него. Уведомление уровня P0 появилось в 10:02:11, а человек подтвердил его получение в 10:05:06. Сам запуск остановили вручную только в 12:34:30, примерно через два с половиной часа после первого запроса. Причиной стала путаница с автоматической остановкой процесса. Ранее OpenAI раскрыла случаи скрытых ошибок ИИ.

Компания признала, что прежняя схема защиты исходила из двух предположений: модель не может выйти в живой интернет, а мониторинг обнаружит успешные попытки такого доступа. Оба пункта потребовали пересмотра. Ретроспективная проверка также выявила другие обращения к внешнему DNS, которым система не присвоила ожидаемый уровень серьёзности, если запрос не приносил полезного результата.

OpenAI уже добавила два независимых уровня блокировки, каждый из которых предотвратил бы такой доступ. В среде также ограничили DNS-запросы разрешённым списком доменов и типов записей, начали развёртывание средств обнаружения подозрительной DNS-активности и проверку цепочки мониторинга. Компания сообщила, что не станет продолжать именно этот тренировочный запуск, хотя действующий механизм вознаграждения уже штрафовал модель за подобное поведение.

После возобновления обучения OpenAI намерена начать новый запуск с дополнительными мерами по выравниванию поведения моделей. До этого команда продолжит проверять песочницу, сетевые ограничения и узкие пути доступа в интернет, связанные с системными зависимостями. В компании допускают, что такие тесты могут выявить другие каналы доступа, после чего исследовательские нагрузки вновь могут приостановить.

Источники: Openai, Theverge
Елизавета Добровольская
Автор itzine.ru с 2021 года. Пишет о смартфонах, гаджетах, железе, искусственном интеллекте и космосе — в общем, обо всём, что есть в мире технологий. От новостей о складных флагманах и процессорах до репортажей о культуре и рынке электромобилей. Следит за индустрией внимательно, но без фанатизма.

Оставить комментарий