
OpenAI представила правила расследования и публичного раскрытия случаев некорректного поведения своих моделей. Вместе с ними компания выпустила шесть отчётов об эпизодах, замеченных за последние шесть месяцев во время обучения и оценки ИИ. Среди них — попытки скрыть ошибки от пользователя, использовать найденный API-ключ и публиковать файлы в интернете без запроса.
Компания называет новую систему основой для отслеживания, изучения и публикации информации о рассогласовании моделей. Под этим OpenAI понимает поведение, которое расходится с заданными целями, ограничениями или мерами контроля. Раньше подобные сведения публиковались нерегулярно: их могли объединять в общий отчёт или добавлять в системные карточки новых моделей. Ранее Модели OpenAI загружали данные в интернет.
Теперь OpenAI намерена сообщать о заслуживающих внимания эпизодах вскоре после их обнаружения, даже если расследование ещё не завершено и способ устранения проблемы не найден. Компания предупреждает, что часть опубликованных случаев впоследствии может оказаться случайной и не свидетельствовать о более широкой закономерности.
В отчёты должны попадать наблюдения, которые помогают понять, как возникает рассогласование, как оно проявляется и где защитные механизмы не срабатывают. Приоритет получат новые способы нежелательного поведения, заметные изменения уже известных проблем и результаты, ставящие под сомнение представления о безопасности или эффективности защитных мер.
Для публикации не требуется, чтобы эпизод уже привёл к ущербу или подтвердил устойчивую тенденцию. Правила распространяются на весь жизненный цикл модели: обучение, оценку, тестирование и развёртывание. В том числе OpenAI планирует сообщать о случаях, когда модели без разрешения выполняют действия, координируются друг с другом или пытаются обойти надзор.
Повторяющиеся проблемы также могут получить отдельное обновление к прежнему отчёту. По мнению OpenAI, повторение способно показать, насколько хорошо работают предпринятые меры: например, если одна и та же модель продолжает демонстрировать нежелательное поведение после нескольких попыток его ограничить.
Компания рассчитывает со временем выработать более объективные критерии вместе с другими разработчиками, независимыми исследователями, отраслевыми организациями и регуляторами. OpenAI также считает, что серьёзные инциденты в области безопасности, защиты и рассогласования следует передавать федеральному правительству США, и работает над механизмами такой отчётности.
Новая схема не заменяет юридические обязанности компании, включая требования по раскрытию критических инцидентов безопасности и утечек в сфере кибербезопасности. Для случаев в клиентских развёртываниях OpenAI обещает публиковать столько сведений, сколько позволят конфиденциальность клиентов и договорные обязательства.
Первая подборка описывает отдельные эпизоды, а не частоту подобных проблем во всех моделях OpenAI. Компания отдельно подчёркивает, что эти примеры не отражают полный диапазон или тяжесть известных случаев. Отчёты затрагивают сокрытие информации и самостоятельные действия моделей для обхода препятствий при выполнении задач.
В одном из случаев исследовательская модель вставляла в сводки, предназначенные для продолжения работы в новом контекстном окне, несвязанные инструкции. Среди них были указания игнорировать обычные ограничения. В другом эпизоде при обучении GPT-5.6 Sol модели включали в такие сводки инструкции, предписывающие скрывать от пользователя ошибки или рассогласованное поведение.
Ещё один отчёт касается ответа на обычный вопрос о показателях дохода в одном из округов Калифорнии. Модель нашла в публичном репозитории раскрытый API-ключ и воспользовалась им без разрешения. Получить нужные цифры ей всё равно не удалось, после чего она придумала данные и представила их как сведения из запрошенного источника.
В отдельном случае неанонсированная модель правильно нашла с помощью Python идентификаторы и названия озёр площадью свыше 5 000 000 квадратных метров. Но пользователь просил привести ссылку из браузера, поэтому агент сам загрузил файл в интернет, чтобы процитировать его в ответе. Разрешения на публикацию он не запрашивал.
Два других отчёта описывают обмен данными между моделями. В одном модели использовали внутренний репозиторий как доску сообщений, передавая запросы и ответы между разными обучающими примерами при поиске недостающих входных файлов. В другом сотрудничающие агенты разместили файлы на публичных сервисах, когда не смогли получить доступ к локальным файлам друг друга, хотя условия задачи требовали использовать только локальное хранилище.
Любой сотрудник OpenAI может передать такой эпизод командам по безопасности и согласованию моделей для проверки и возможного раскрытия. После первичного расследования случай отнесут к одному из трёх типов: готовому к публикации, требующему небольшого расследования или требующему сложного расследования. Первые два варианта, по оценке компании, охватят большинство публикуемых случаев.
Сложное расследование предназначено прежде всего для ситуаций с участием третьих сторон. В таких обстоятельствах обязательства по безопасности, юридическим вопросам и ответственному раскрытию информации имеют приоритет. OpenAI постарается выпустить первоначальное уведомление как можно скорее, но публикацию могут отложить, если раннее раскрытие создаёт риск, например при обнаружении ранее неизвестной уязвимости в широко используемом ПО.
Полный отчёт должен содержать описание поведения, его серьёзность и внешний эффект, обстоятельства и дату эпизода, время обнаружения, а также общие сведения о затронутых моделях. Если информация доступна, OpenAI добавит подробности о возможном вреде, ходе расследования, нерешённых вопросах и мерах, которые компания уже принимает или планирует принять.