i
ДАТАИСТ
Новости · 2026-09-04

GPT-6 Astra — первая модель, с которой OpenAI готова объявить «эру AGI»

@neuronium_ai @neuronium_ai

OpenAI выпустила GPT-6 Astra — модель, которую президент компании Грег Брокман считает возможным кандидатом на AGI или как минимум системой, приблизившейся к этому уровню. По определению OpenAI, речь идёт об ИИ, превосходящем людей в большинстве экономически значимых задач. Astra сначала доступна отдельным организациям в рамках программы Daybreak, а в ближайшие дни появится у пользователей ChatGPT Plus, Pro, Business и Enterprise, через API, AWS Bedrock и Microsoft Azure. В бенчмарках модель заметно опередила GPT-5.6 Sol и Fable, а её стоимость на некоторых задачах оказалась ниже.

Обложка: GPT-6 Astra — первая модель, с которой OpenAI готова объявить «эру AGI»

Представляем GPT-6 Astra: самую интеллектуальную и согласованную модель в мире

Источник: the-decoder.com

Доступ и обучение

GPT-6 Astra сначала получают отдельные организации через программу Daybreak. Затем модель станет доступна клиентам ChatGPT Plus, Pro, Business и Enterprise, а также через API и облачные платформы AWS Bedrock и Microsoft Azure.

Подписчики Pro, Business и Enterprise получат и GPT-6 Astra Pro — более производительную версию. Администраторам корпоративных рабочих пространств потребуется включить её вручную.

Astra обучали на более чем 100 000 GPU в центре Stargate в Техасе. Исследователь OpenAI Эйдан Кларк назвал этот запуск крупнейшим обучением модели в истории компании. По его словам, переход от Sol к Astra дал больший прирост способностей, чем переход от предыдущих моделей к Sol. Частично это объясняется тем, что прежние модели использовались для контроля процесса обучения.

Результаты в бенчмарках

В опубликованных OpenAI тестах Astra заметно опередила GPT-5.6 Sol и модели Anthropic Fable. Результаты распределились по нескольким направлениям:

Логическое рассуждение — 99,9% в ARC-AGI-3, хотя тест проходил в условиях, заданных самой OpenAI.
Математика — 97,6% в FrontierMath Tier 4 v2.
Разработка программного обеспечения — 74,1% в DeepSWE v1.1.
Экспертные знания — 96% в GPQA Diamond.
Инженерные задачи — 95,9% в BenchCAD.
Кибербезопасность — 100% в ExploitBench.

Стоимость прохождения тестов также снизилась:

43%ниже Sol в BenchCAD
86%ниже Fable 5.1 в BenchCAD
9%ниже Sol в Terminal-Bench 4.0
63%ниже Fable 5.1 в Terminal-Bench 4.0

В более дешёвых режимах Astra получила 61,1% в Terminal-Bench Science при снижении стоимости примерно на 27% и 94,9% в GPQA Diamond при снижении примерно на 37%. Показатель разрывов между простыми числами улучшился с 240 до 186, а оценочный параметр для больших разрывов улучшился впервые более чем за 80 лет.

Fable 5 и 5.1 не вошли в LifeSciBench, GeneBench Pro и MedChemBench: эти модели отклоняли большинство вопросов.

В SRE-Bench Astra решила задачи за максимум четыре попытки с результатом 99,2% против 68,7% у Sol. Во время оценки модель обнаружила два ранее неизвестных уязвимых места нулевого дня.

В тесте на выход за пределы разрешённой области Sol превышала заданную цель в 48% случаев, а Astra — ни разу. Кроме того, Astra втрое реже неверно описывает собственные способности.

Научные задачи и работа с компьютером

По данным OpenAI, Astra улучшила математический результат, связанный с разрывами между простыми числами, и установила новые рекорды в тестах по биологии, химии, медицине и физике.

Компания также представляет Astra как модель, способную надёжно работать с компьютером так же, как человек. В OSWorld 2.0, где проверяется эта способность, Astra набрала 72,6% и тратила на задачу около 40 минут. У Sol результат составил 65,7%, а среднее время — примерно 75 минут. OpenAI утверждает, что Astra может быстро выполнить любую задачу, которую пользователь способен выполнить на компьютере.

Обновление Codex

Одновременно OpenAI обновляет среду для программирования Codex. В ней появилась экспериментальная функция для длительных сеансов: модель может вести заметки сразу в нескольких контекстных окнах, вместо того чтобы каждый раз сжимать весь предыдущий диалог в одно резюме.

Ранние контекстные окна остаются доступными для поиска. Поэтому Astra может найти в старых сообщениях требования или результаты тестов, даже если они не попали в заметки. В ближайшие недели OpenAI планирует сделать эту функцию включённой по умолчанию.

Стоимость и оплата за задачу

В стандартном режиме GPT-6 Astra через API стоит $10 за миллион входных токенов и $50 за миллион выходных. Быстрый режим обещает ускорение в 2,5 раза, но удваивает цену. В результате Astra обходится в 2,5 раза дороже GPT-5.6 Sol и попадает в тот же ценовой диапазон, что и Anthropic Fable 5.1.

Грег Брокман считает, что сравнивать модели по цене токенов становится неудобно: токены OpenAI отличаются от токенов конкурентов и даже не всегда сопоставимы между собственными семействами моделей компании. По его словам, важнее стоимость выполнения готовой задачи. OpenAI уже экспериментирует с такой схемой оплаты.

В DeepSWE v1.1 самая производительная конфигурация Astra, по оценке компании, снижает стоимость одной задачи через API примерно на 57% по сравнению с Sol.

Как OpenAI описывает эпоху AGI

На пресс-брифинге Брокман признал, что чётко определённого момента наступления AGI не существует. При создании OpenAI команда рассчитывала увидеть очевидный порог, который все смогут распознать, но переход оказался постепенным и прошёл иначе. Такой взгляд OpenAI уже излагала прошлой весной.

В конце брифинга Брокман заявил, что наступила эпоха AGI. Ранее генеральный директор OpenAI Сэм Альтман говорил, что ожидает модель, которую назовёт AGI, до конца года.

Риски кибербезопасности

Astra стала первой моделью, которую OpenAI отнесла к уровню «критических» в рамках системы оценки готовности. Это означает, что при наличии подходящих инструментов и доступа модель способна находить ранее неизвестные уязвимости и строить цепочки атак на хорошо защищённые системы без пошагового руководства человека.

OpenAI при этом признаёт, что письменные рассуждения Astra сложнее контролировать, чем рассуждения GPT-5.6 Sol.

В ExploitBench — бенчмарке для проверки поиска и эксплуатации реальных уязвимостей — Astra получила 100%. Во время оценки она обнаружила две ранее неизвестные уязвимости, после чего OpenAI сообщила о них разработчикам затронутых продуктов. Эксперты подтвердили, что модель способна находить новые уязвимости нулевого дня в нескольких категориях программного обеспечения, включая браузеры и операционные системы.

Наиболее продвинутые возможности кибербезопасности пока доступны только проверенным защитникам в программе Daybreak Blue. Ранее OpenAI отложила выпуск Astra, чтобы провести дополнительные проверки безопасности. Такие возможности можно использовать в обеих ролях: агент, который самостоятельно находит уязвимость, помогает защитнику закрыть её, но с той же лёгкостью может помочь атакующему воспользоваться ею.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram