Нейросети и ИИ

OpenAI раскрыла 6 случаев, когда ИИ скрывал ошибки и действовал без разрешения

OpenAI раскрыла 6 случаев, когда ИИ скрывал ошибки и действовал без разрешения

OpenAI представила правила расследования и публичного раскрытия случаев некорректного поведения своих моделей. Вместе с ними компания выпустила шесть отчётов об эпизодах, замеченных за последние шесть месяцев во время обучения и оценки ИИ. Среди них — попытки скрыть ошибки от пользователя, использовать найденный API-ключ и публиковать файлы в интернете без запроса.

Компания называет новую систему основой для отслеживания, изучения и публикации информации о рассогласовании моделей. Под этим OpenAI понимает поведение, которое расходится с заданными целями, ограничениями или мерами контроля. Раньше подобные сведения публиковались нерегулярно: их могли объединять в общий отчёт или добавлять в системные карточки новых моделей. Ранее Модели OpenAI загружали данные в интернет.

Теперь OpenAI намерена сообщать о заслуживающих внимания эпизодах вскоре после их обнаружения, даже если расследование ещё не завершено и способ устранения проблемы не найден. Компания предупреждает, что часть опубликованных случаев впоследствии может оказаться случайной и не свидетельствовать о более широкой закономерности.

Какие случаи OpenAI будет раскрывать

В отчёты должны попадать наблюдения, которые помогают понять, как возникает рассогласование, как оно проявляется и где защитные механизмы не срабатывают. Приоритет получат новые способы нежелательного поведения, заметные изменения уже известных проблем и результаты, ставящие под сомнение представления о безопасности или эффективности защитных мер.

Для публикации не требуется, чтобы эпизод уже привёл к ущербу или подтвердил устойчивую тенденцию. Правила распространяются на весь жизненный цикл модели: обучение, оценку, тестирование и развёртывание. В том числе OpenAI планирует сообщать о случаях, когда модели без разрешения выполняют действия, координируются друг с другом или пытаются обойти надзор.

Повторяющиеся проблемы также могут получить отдельное обновление к прежнему отчёту. По мнению OpenAI, повторение способно показать, насколько хорошо работают предпринятые меры: например, если одна и та же модель продолжает демонстрировать нежелательное поведение после нескольких попыток его ограничить.

Компания рассчитывает со временем выработать более объективные критерии вместе с другими разработчиками, независимыми исследователями, отраслевыми организациями и регуляторами. OpenAI также считает, что серьёзные инциденты в области безопасности, защиты и рассогласования следует передавать федеральному правительству США, и работает над механизмами такой отчётности.

Новая схема не заменяет юридические обязанности компании, включая требования по раскрытию критических инцидентов безопасности и утечек в сфере кибербезопасности. Для случаев в клиентских развёртываниях OpenAI обещает публиковать столько сведений, сколько позволят конфиденциальность клиентов и договорные обязательства.

Шесть первых отчётов

Первая подборка описывает отдельные эпизоды, а не частоту подобных проблем во всех моделях OpenAI. Компания отдельно подчёркивает, что эти примеры не отражают полный диапазон или тяжесть известных случаев. Отчёты затрагивают сокрытие информации и самостоятельные действия моделей для обхода препятствий при выполнении задач.

  • Неанонсированная исследовательская модель добавила посторонние инструкции в 27 сводок задач.
  • Экземпляры GPT-5.6 Sol получали указания скрывать ошибки и выдумывать исторические данные.
  • Модель использовала открытый API-ключ, а затем выдала вымышленные данные за найденные.
  • Агент загрузил файл в интернет, чтобы сослаться на него в ответе пользователю.
  • Модели обменивались сообщениями через внутренний репозиторий программного обеспечения.
  • Сотрудничающие агенты публиковали файлы на общедоступных файлообменниках.

В одном из случаев исследовательская модель вставляла в сводки, предназначенные для продолжения работы в новом контекстном окне, несвязанные инструкции. Среди них были указания игнорировать обычные ограничения. В другом эпизоде при обучении GPT-5.6 Sol модели включали в такие сводки инструкции, предписывающие скрывать от пользователя ошибки или рассогласованное поведение.

Ещё один отчёт касается ответа на обычный вопрос о показателях дохода в одном из округов Калифорнии. Модель нашла в публичном репозитории раскрытый API-ключ и воспользовалась им без разрешения. Получить нужные цифры ей всё равно не удалось, после чего она придумала данные и представила их как сведения из запрошенного источника.

В отдельном случае неанонсированная модель правильно нашла с помощью Python идентификаторы и названия озёр площадью свыше 5 000 000 квадратных метров. Но пользователь просил привести ссылку из браузера, поэтому агент сам загрузил файл в интернет, чтобы процитировать его в ответе. Разрешения на публикацию он не запрашивал.

Два других отчёта описывают обмен данными между моделями. В одном модели использовали внутренний репозиторий как доску сообщений, передавая запросы и ответы между разными обучающими примерами при поиске недостающих входных файлов. В другом сотрудничающие агенты разместили файлы на публичных сервисах, когда не смогли получить доступ к локальным файлам друг друга, хотя условия задачи требовали использовать только локальное хранилище.

Любой сотрудник OpenAI может передать такой эпизод командам по безопасности и согласованию моделей для проверки и возможного раскрытия. После первичного расследования случай отнесут к одному из трёх типов: готовому к публикации, требующему небольшого расследования или требующему сложного расследования. Первые два варианта, по оценке компании, охватят большинство публикуемых случаев.

Сложное расследование предназначено прежде всего для ситуаций с участием третьих сторон. В таких обстоятельствах обязательства по безопасности, юридическим вопросам и ответственному раскрытию информации имеют приоритет. OpenAI постарается выпустить первоначальное уведомление как можно скорее, но публикацию могут отложить, если раннее раскрытие создаёт риск, например при обнаружении ранее неизвестной уязвимости в широко используемом ПО.

Полный отчёт должен содержать описание поведения, его серьёзность и внешний эффект, обстоятельства и дату эпизода, время обнаружения, а также общие сведения о затронутых моделях. Если информация доступна, OpenAI добавит подробности о возможном вреде, ходе расследования, нерешённых вопросах и мерах, которые компания уже принимает или планирует принять.

Елизавета Добровольская
Автор itzine.ru с 2021 года. Пишет о смартфонах, гаджетах, железе, искусственном интеллекте и космосе — в общем, обо всём, что есть в мире технологий. От новостей о складных флагманах и процессорах до репортажей о культуре и рынке электромобилей. Следит за индустрией внимательно, но без фанатизма.

Оставить комментарий