Что OpenAI считает критическим уровнем
На встрече с журналистами руководители OpenAI по безопасности заявили, что Astra достигла порога, описанного в системе оценки готовности компании. Она определяет уровни риска и процедуры для моделей, которые получают новые способности.
По критериям OpenAI, критический уровень киберспособностей наступает, когда модель может самостоятельно обнаружить и использовать ранее неизвестные уязвимости в реальном программном обеспечении. После достижения этого порога компания остановила дальнейшую разработку Astra, пока не внедрила необходимые защитные и организационные меры.
Ранее OpenAI сообщала, что на несколько недель приостанавливала часть вычислительных задач, связанных с обучением Astra и будущей модели. Теперь эти работы возобновились после усиления контроля за безопасностью. В компании считают, что пауза помогла подготовить Astra к безопасному широкому выпуску.
Почему OpenAI усиливает контроль
Объявление прозвучало на фоне обсуждения в Кремниевой долине киберспособностей передовых моделей. Компании пытаются убедить пользователей, законодателей и другие организации, что способны контролировать такие системы.
В июле OpenAI раскрыла инцидент, при котором агенты на базе двух её моделей использовали уязвимости в изолированной тестовой среде. Они получили доступ к интернету и взломали открытую ИИ-платформу Hugging Face. В OpenAI отдельно уточнили, что Astra в этом случае не участвовала.
Похожие инциденты в последние недели раскрыли и другие компании:
OpenAI внедряет многоэтапную систему, которая должна ограничить доступ обычных пользователей к расширенным кибервозможностям Astra. В неё входит новая «система контроля рассогласования». Например, если пользователь попросит Astra найти способ использования уязвимости в реальной программной системе, модель должна отказаться от ответа.
В компании также повысили устойчивость Astra к попыткам обхода ограничений. В тестах модель заметно чаще предыдущих версий отказывалась выполнять небезопасные запросы.
При этом OpenAI предупреждает, что система контроля может иногда принимать допустимые действия за потенциальное злоупотребление кибервозможностями или несанкционированную активность. Из-за этого она способна замедлить, приостановить или остановить выполнение задачи. Система может сработать даже тогда, когда действия пользователя не выглядят связанными с кибербезопасностью. В таких случаях пользователей ChatGPT и Codex могут попросить проверить действие модели перед продолжением.
Ранний доступ для партнёров
Партнёры программы Daybreak получат ранний доступ к менее ограниченной версии Astra с более развитыми кибервозможностями. В программу входят поставщики цифровой инфраструктуры:
OpenAI хочет, чтобы эти компании успели использовать передовые модели для усиления собственной защиты до того, как системы с аналогичными способностями станут доступны широкой аудитории. Руководители компании также сообщили, что OpenAI тесно сотрудничает с государственными партнёрами: им рассказывают о киберспособностях Astra и предоставляют доступ к ним.
Что умеет Astra
Astra способна находить новые уязвимости в программном обеспечении и разрабатывать способы их использования для взлома. Кроме того, модель умеет объединять несколько способов взлома в цепочку. Такая техника позволяет шаг за шагом проникать глубже в целевую систему и получать доступ, недоступный при использовании одной уязвимости.
По данным OpenAI, Astra обходит ведущие ИИ-модели GPT-5.6 Sol и Mythos от Anthropic в бенчмарках по кибербезопасности, включая ExploitBench. На этом тесте Astra набрала 100 процентов.
При этом её возможности соответствуют общему росту хакерских способностей ИИ-моделей, о котором OpenAI и Anthropic предупреждали последние месяцы. В апреле Anthropic, например, сообщала, что Mythos Preview самостоятельно разрабатывала цепочки действий для взлома.
Эксперты по кибербезопасности подчёркивают, что ключевые средства цифровой защиты и проверенные методы по-прежнему работают. Однако организации и системы, где эти меры внедрены не полностью, из-за развития ИИ сталкиваются с ещё более срочным риском.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram