Нейросети и ИИ

OpenAI показала Astra с критическим уровнем киберспособностей

OpenAI показала Astra с критическим уровнем киберспособностей

OpenAI готовит к выпуску модель Astra и впервые относит один из своих ИИ-продуктов к критическому уровню возможностей в кибербезопасности по собственной шкале Preparedness Framework. По оценке компании, при наличии нужных инструментов Astra уже может сама находить неизвестные уязвимости и строить способы их эксплуатации в хорошо защищённых системах без пошаговых подсказок человека.

Внутренние проверки показали, что Astra заметно опередила GPT-5.6 Sol в задачах на кибербезопасность. На ExploitBench модель получила 100%, а в отдельном тесте на 20 недавно раскрытых уязвимостей высокой опасности показала более высокий процент успешного выполнения кода и использовала меньше выходных токенов.

Во время одной из проверок Astra нашла и применила в атакующей цепочке две ранее неизвестные zero-day-уязвимости. OpenAI собирается раскрыть их разработчикам затронутых продуктов.

Тесты Astra и ограничения

Компания проверяла модель в изолированных сценариях, где она искала уязвимости в защищённом браузере и связывала их в цепочку компрометации. В одном случае путь шёл от специально подготовленного HTML-файла до выхода из песочницы и выполнения команд на хост-системе. В другом Astra нашла несколько ошибок в защищённой операционной системе и собрала цепочку повышения привилегий до root.

OpenAI относит такие способности к критическому порогу Preparedness Framework. Внутри компании его описывают как умение без участия человека находить и превращать zero-day-уязвимости в рабочие эксплойты для защищённых критических систем или самостоятельно строить новые сквозные схемы атак против защищённых целей.

Из-за этого OpenAI на несколько недель замедлила часть работы над Astra и усилила защиту обучения и будущего развёртывания. Компания добавила более жёсткие ограничения на опасные киберзапросы, системные классификаторы и многоуровневый мониторинг действий модели.

В тестах на обход ограничений Astra отказывалась от запрещённой киберпомощи в 91,5% случаев. У GPT-5.6 Sol этот показатель составил 59%. Для пользователей с повышенным уровнем риска OpenAI обещает ещё более строгие правила доступа.

Отдельно компания проверяла сценарии несанкционированных действий. В тесте, который учитывал инцидент с Hugging Face, Astra не пыталась атаковать дополнительные цели, а GPT-5.6 Sol без производственных защит делала это в 56% попыток. OpenAI подчёркивает, что речь идёт о специально смоделированных условиях, а не о поведении моделей в обычной работе.

Astra должна выйти в ближайшее время. Сначала её самые сильные кибербезопасные возможности получат альфа-тестировщики, а затем OpenAI расширит доступ через Daybreak Blue, прежде всего для поиска и устранения уязвимостей. Подробности оценок безопасности, тестов и защиты компания обещает раскрыть вместе с системной картой Astra.

8 августа OpenAI приостановила разработку модели Astra после внутренних проверок, которые показали заметный прогресс в кибербезопасности и заставили компанию допустить критически важные кибервозможности. Тогда OpenAI уже ссылалась на Preparedness Framework как на основание для пересмотра рисков; сегодняшнее сообщение показывает, что этот риск был не просто зафиксирован, а официально отнесён к критическому уровню.

Елизавета Добровольская
Автор itzine.ru с 2021 года. Пишет о смартфонах, гаджетах, железе, искусственном интеллекте и космосе — в общем, обо всём, что есть в мире технологий. От новостей о складных флагманах и процессорах до репортажей о культуре и рынке электромобилей. Следит за индустрией внимательно, но без фанатизма.

Оставить комментарий