OpenAI показала Astra с критическим уровнем киберспособностей

OpenAI готовит к выпуску модель Astra и впервые относит один из своих ИИ-продуктов к критическому уровню возможностей в кибербезопасности по собственной шкале Preparedness Framework. По оценке компании, при наличии нужных инструментов Astra уже может сама находить неизвестные уязвимости и строить способы их эксплуатации в хорошо защищённых системах без пошаговых подсказок человека.
Внутренние проверки показали, что Astra заметно опередила GPT-5.6 Sol в задачах на кибербезопасность. На ExploitBench модель получила 100%, а в отдельном тесте на 20 недавно раскрытых уязвимостей высокой опасности показала более высокий процент успешного выполнения кода и использовала меньше выходных токенов.
Во время одной из проверок Astra нашла и применила в атакующей цепочке две ранее неизвестные zero-day-уязвимости. OpenAI собирается раскрыть их разработчикам затронутых продуктов.
Тесты Astra и ограничения
Компания проверяла модель в изолированных сценариях, где она искала уязвимости в защищённом браузере и связывала их в цепочку компрометации. В одном случае путь шёл от специально подготовленного HTML-файла до выхода из песочницы и выполнения команд на хост-системе. В другом Astra нашла несколько ошибок в защищённой операционной системе и собрала цепочку повышения привилегий до root.
OpenAI относит такие способности к критическому порогу Preparedness Framework. Внутри компании его описывают как умение без участия человека находить и превращать zero-day-уязвимости в рабочие эксплойты для защищённых критических систем или самостоятельно строить новые сквозные схемы атак против защищённых целей.
Из-за этого OpenAI на несколько недель замедлила часть работы над Astra и усилила защиту обучения и будущего развёртывания. Компания добавила более жёсткие ограничения на опасные киберзапросы, системные классификаторы и многоуровневый мониторинг действий модели.
В тестах на обход ограничений Astra отказывалась от запрещённой киберпомощи в 91,5% случаев. У GPT-5.6 Sol этот показатель составил 59%. Для пользователей с повышенным уровнем риска OpenAI обещает ещё более строгие правила доступа.
Отдельно компания проверяла сценарии несанкционированных действий. В тесте, который учитывал инцидент с Hugging Face, Astra не пыталась атаковать дополнительные цели, а GPT-5.6 Sol без производственных защит делала это в 56% попыток. OpenAI подчёркивает, что речь идёт о специально смоделированных условиях, а не о поведении моделей в обычной работе.
Astra должна выйти в ближайшее время. Сначала её самые сильные кибербезопасные возможности получат альфа-тестировщики, а затем OpenAI расширит доступ через Daybreak Blue, прежде всего для поиска и устранения уязвимостей. Подробности оценок безопасности, тестов и защиты компания обещает раскрыть вместе с системной картой Astra.
8 августа OpenAI приостановила разработку модели Astra после внутренних проверок, которые показали заметный прогресс в кибербезопасности и заставили компанию допустить критически важные кибервозможности. Тогда OpenAI уже ссылалась на Preparedness Framework как на основание для пересмотра рисков; сегодняшнее сообщение показывает, что этот риск был не просто зафиксирован, а официально отнесён к критическому уровню.



