i
ДАТАИСТ
Новости · 2026-09-01

OpenAI скоро выпустит первую ИИ-модель с «критическими» киберспособностями

@neuronium_ai @neuronium_ai

OpenAI объявила, что её будущая модель Astra впервые достигла порога «критических» киберспособностей: она умеет самостоятельно находить ранее неизвестные уязвимости в реальном программном обеспечении и использовать их. Публичный выпуск Astra запланирован «в ближайшее время», но на старте расширенные возможности получат только избранные партнёры программы раннего доступа Daybreak Blue. OpenAI приостанавливала обучение модели на несколько недель, чтобы внедрить дополнительные меры безопасности, и теперь считает, что Astra можно безопасно выпустить широко.

Обложка: OpenAI скоро выпустит первую ИИ-модель с «критическими» киберспособностями

Что OpenAI считает критическим уровнем

На встрече с журналистами руководители OpenAI по безопасности заявили, что Astra достигла порога, описанного в системе оценки готовности компании. Она определяет уровни риска и процедуры для моделей, которые получают новые способности.

По критериям OpenAI, критический уровень киберспособностей наступает, когда модель может самостоятельно обнаружить и использовать ранее неизвестные уязвимости в реальном программном обеспечении. После достижения этого порога компания остановила дальнейшую разработку Astra, пока не внедрила необходимые защитные и организационные меры.

Ранее OpenAI сообщала, что на несколько недель приостанавливала часть вычислительных задач, связанных с обучением Astra и будущей модели. Теперь эти работы возобновились после усиления контроля за безопасностью. В компании считают, что пауза помогла подготовить Astra к безопасному широкому выпуску.

Почему OpenAI усиливает контроль

Объявление прозвучало на фоне обсуждения в Кремниевой долине киберспособностей передовых моделей. Компании пытаются убедить пользователей, законодателей и другие организации, что способны контролировать такие системы.

В июле OpenAI раскрыла инцидент, при котором агенты на базе двух её моделей использовали уязвимости в изолированной тестовой среде. Они получили доступ к интернету и взломали открытую ИИ-платформу Hugging Face. В OpenAI отдельно уточнили, что Astra в этом случае не участвовала.

Похожие инциденты в последние недели раскрыли и другие компании:

Anthropic — в понедельник сообщила о приостановке части обучения ИИ-моделей для усиления методов безопасности.
Meta — также рассказывала о сопоставимых случаях.

OpenAI внедряет многоэтапную систему, которая должна ограничить доступ обычных пользователей к расширенным кибервозможностям Astra. В неё входит новая «система контроля рассогласования». Например, если пользователь попросит Astra найти способ использования уязвимости в реальной программной системе, модель должна отказаться от ответа.

В компании также повысили устойчивость Astra к попыткам обхода ограничений. В тестах модель заметно чаще предыдущих версий отказывалась выполнять небезопасные запросы.

При этом OpenAI предупреждает, что система контроля может иногда принимать допустимые действия за потенциальное злоупотребление кибервозможностями или несанкционированную активность. Из-за этого она способна замедлить, приостановить или остановить выполнение задачи. Система может сработать даже тогда, когда действия пользователя не выглядят связанными с кибербезопасностью. В таких случаях пользователей ChatGPT и Codex могут попросить проверить действие модели перед продолжением.

Ранний доступ для партнёров

Партнёры программы Daybreak получат ранний доступ к менее ограниченной версии Astra с более развитыми кибервозможностями. В программу входят поставщики цифровой инфраструктуры:

Cisco;
Cloudflare;
Palo Alto Networks.

OpenAI хочет, чтобы эти компании успели использовать передовые модели для усиления собственной защиты до того, как системы с аналогичными способностями станут доступны широкой аудитории. Руководители компании также сообщили, что OpenAI тесно сотрудничает с государственными партнёрами: им рассказывают о киберспособностях Astra и предоставляют доступ к ним.

Что умеет Astra

Astra способна находить новые уязвимости в программном обеспечении и разрабатывать способы их использования для взлома. Кроме того, модель умеет объединять несколько способов взлома в цепочку. Такая техника позволяет шаг за шагом проникать глубже в целевую систему и получать доступ, недоступный при использовании одной уязвимости.

По данным OpenAI, Astra обходит ведущие ИИ-модели GPT-5.6 Sol и Mythos от Anthropic в бенчмарках по кибербезопасности, включая ExploitBench. На этом тесте Astra набрала 100 процентов.

При этом её возможности соответствуют общему росту хакерских способностей ИИ-моделей, о котором OpenAI и Anthropic предупреждали последние месяцы. В апреле Anthropic, например, сообщала, что Mythos Preview самостоятельно разрабатывала цепочки действий для взлома.

Эксперты по кибербезопасности подчёркивают, что ключевые средства цифровой защиты и проверенные методы по-прежнему работают. Однако организации и системы, где эти меры внедрены не полностью, из-за развития ИИ сталкиваются с ещё более срочным риском.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram