Модель для работы с компьютером
Слухи подтвердились: OpenAI выпускает GPT-6 Astra и связывает её с давней целью AGI — созданием высокоавтономных систем, способных превосходить людей в большинстве экономически значимых задач.
На закрытом пресс-брифинге Грег Брокман сформулировал позицию компании предельно прямо: по его словам, наступает эпоха AGI.
Для компаний более практическое значение Astra связано с другим. OpenAI представляет модель как новый этап работы с компьютерами, где пользователю — в том числе сотруднику — больше не обязательно постоянно нажимать мышью и печатать на клавиатуре.
В материалах OpenAI, заранее переданных VentureBeat, Astra названа лучшей в мире моделью для работы с компьютером.
Разработчикам больше не нужно отдельно подключать ИИ к каждому приложению через специальный API. Astra должна перемещаться по программам примерно так же, как человек:
В рекламном ролике OpenAI сначала показала демонстрацию 1980-х годов: человек просит компьютер нарисовать жёлтый круг, и система выполняет простую команду. Затем действие переносится в настоящее: сотрудники OpenAI голосом просят Astra превратить круг в ракету, а затем — в полноценную трёхмерную игру за несколько минут. В другой сцене модель создаёт объявление на eBay, также получая команды только голосом.
С четверга Astra начинают постепенно предоставлять корпоративным клиентам через закрытую программу OpenAI Daybreak. В ближайшие дни модель должна стать доступна пользователям ChatGPT Plus, Pro, Business и Enterprise, а также через OpenAI API и облачные платформы AWS Bedrock и Microsoft Azure.
Что Astra умеет делать
Корпоративный сценарий Astra во многом строится вокруг работы с компьютером. OpenAI заявляет, что модель способна:
Такой подход может изменить архитектуру корпоративных ИИ-систем. Во время бума генеративного ИИ компаниям приходилось подключать модели к внутренним системам через API, плагины, поисковые системы и специально созданные инструменты.
Брокман считает, что ИИ-агенты, способные работать с компьютером, частично избавят компании от этой интеграционной работы. В качестве универсального интерфейса уже существует пользовательский интерфейс, рассчитанный на человека.
По его словам, многие годы компании упирались в необходимость вручную писать соединители и тщательно встраивать модели во все инструменты. При достаточной способности работать с компьютером агент сможет сам переходить между страницами, заполнять формы и обрабатывать таблицы.
Эта идея появилась ещё в первые годы существования OpenAI. Исследователи обсуждали обучение агента на тех же базовых входах и выходах, которые доступны человеку: пикселях, клавиатуре и мыши. Теперь, по словам Брокмана, OpenAI создала первого агента, который делает это достаточно полезно на практике.
В офлайн-подмножестве OSWorld 2.0 Astra набрала 72,6%, выполняя задание примерно за 40 минут. GPT-5.6 Sol получила 65,7%, но тратила около 75 минут на задачу. Таким образом, Astra справлялась примерно на 47% быстрее.
OpenAI также показала, как Astra одновременно создаёт трёхмерную игру, готовит юридическое соглашение и обрабатывает посторонние запросы. Модель должна выйти за пределы привычного сценария чат-бота, где человек после каждого шага заново указывает, что делать дальше.
Исследовательница OpenAI Миа Глезе заявила, что пользователи получают возможность делегировать значительно более сложную работу сразу в нескольких приложениях, а сами люди переходят к управлению задачами на более высоком уровне.
Речь идёт о переходе от написания запросов для ИИ к надзору за его работой. Для бизнеса это может оказаться важнее очередного улучшения результата на академическом бенчмарке.
Обучение и результаты
Исследователь OpenAI Эйдан Кларк назвал разработку Astra крупнейшим учебным запуском компании.
По его словам, это первая модель OpenAI, которую предварительно обучали с использованием более 100 000 DBU на инфраструктуре Stargate. Также впервые предыдущие модели сыграли значительную роль в надзоре за обучением следующей модели.
OpenAI считает, что переход от Sol к Astra дал больший прирост способностей, чем переход к Sol по сравнению с более ранними моделями.
Компания связывает возможности Astra с сочетанием масштабного предварительного обучения и обучения с подкреплением. Такая схема должна учить модель связывать информацию и выполнять всё более длинные задачи.
OpenAI приводит следующие результаты Astra:
Последняя цифра требует оговорки. ARC-AGI считается одним из наиболее заметных способов проверить, умеют ли ИИ-системы обобщать знания на незнакомые задачи, а не просто воспроизводить способности, полученные во время обучения.
В текущей таблице ARC-AGI-3 обычные запуски передовых моделей значительно уступают заявленному Astra результату в 98,6%. Однако сравнение нельзя считать полностью прямым: в примечаниях OpenAI указано, что Astra использует оболочку Responses API, тогда как другие модели могли работать в иных конфигурациях.
Модель или целая система
Недавний результат NVIDIA показывает, насколько сильно на итоговую оценку может влиять окружение модели. В августе компания сообщила, что её архитектура «агентные операторы вариаций» (AVO) получила 100% на всех 25 окружениях и 183 уровнях публичного набора ARC-AGI-3.
При этом NVIDIA не создавала новую базовую модель, внезапно достигшую 100%. AVO использовала Claude Opus 5, а базовый результат самой модели составлял примерно 30%.
AVO добавляет постоянную память, инструменты, обратную связь и восстановление после ошибок. Благодаря этому агент может сохранять прогресс в длинных задачах, а не воспринимать каждое взаимодействие как отдельное.
Вывод NVIDIA заключался в том, что способность работать на длинной дистанции может появляться у полной агентной системы, а не у одной базовой модели.
В сообществе ИИ это вызвало спор. Один пользователь r/singularity заявил, что ограничения ARC-AGI-3, не позволяющие сохранять контекст между действиями, плохо отражают работу производственных агентов. По его сравнению, это напоминает проверку людей, у которых после каждого действия стирают всё, что они узнали.
Другие участники обсуждения заняли противоположную позицию. По их мнению, сложные оболочки затрудняют проверку того, действительно ли модель обобщила знания. Один из комментаторов предложил выяснить, обобщаются ли способности, или модель просто была переобучена на конкретном бенчмарке.
Так возникает вопрос: что именно измеряется, когда компания заявляет о приближении к AGI?
Для компаний это различие со временем может стать менее важным с практической точки зрения. Бизнес покупает результат работы системы, а не чистоту бенчмарка. Если агент надёжно сверяет счета, расследует инцидент, изменяет рабочую кодовую базу или собирает финансовую модель, заказчику важнее стоимость, надёжность и возможность аудита, чем то, какая часть результата появилась благодаря весам модели, памяти или оркестрации инструментов.
OpenAI, судя по заявлениям Брокмана, готова отстаивать именно такой подход. Он отметил, что у разных людей разные определения AGI. В OpenAI изначально ожидали момента, который все признают одновременно, но на практике граница оказалась размытой.
Говоря лично о Astra, Брокман заявил, что считает возможным назвать её AGI и видит для этого веские основания. Позже он уточнил позицию компании: считать, что OpenAI уже вошла в эпоху AGI, по его мнению, вполне разумно.
Почему нет GDPval
В материалах о запуске Astra отсутствует GDPval — собственный бенчмарк OpenAI для оценки работы на экономически значимых задачах из реального мира.
Компания представила GDPval в 2025 году, чтобы выйти за пределы академических тестов и бенчмарков по программированию. В него вошли 1 320 задач из 44 профессий, связанных с интеллектуальным трудом, и девяти крупных отраслей США.
Задания включают:
Эти сценарии ближе к корпоративным процессам, которые OpenAI теперь обещает автоматизировать с помощью Astra. Поэтому отсутствие результатов GDPval особенно заметно на фоне заявлений об AGI.
Ранее OpenAI представляла этот бенчмарк как способ обсуждать AGI и экономические последствия ИИ через наблюдаемую работу специалистов, а не через предположения. Его задача — измерять, насколько хорошо системы выполняют экономически значимые задачи из реального мира и помогают профессионалам в повседневной работе.
Иными словами, если главное значение Astra связано с тем, что предприятия смогут передать ИИ больше работы, GDPval выглядит одним из наиболее подходящих внутренних показателей OpenAI.
Отсутствие этого результата не отменяет остальные оценки Astra, но оставляет пробел. ARC-AGI-3 показывает интерактивное рассуждение и адаптацию, а DeepSWE и Agents’ Last Exam проверяют отдельные виды программирования и профессиональной работы. GDPval задуман для другого вопроса: способны ли модели создавать результаты, сопоставимые с работой опытных специалистов в широком наборе профессий.
В предыдущих тестах OpenAI передовые системы приближались к экспертному качеству в некоторых задачах GDPval, а между GPT-4o и GPT-5 был зафиксирован заметный прирост.
У бенчмарка есть и ограничение, которое может объяснить, почему OpenAI не сделала на нём акцент. Текущая версия GDPval проверяет работу за один шаг и не измеряет длинные интерактивные процессы сразу в нескольких приложениях — именно те возможности, на которых строится Astra.
Сама OpenAI заявляла, что будущим версиям GDPval понадобятся повторяющиеся рабочие процессы, более богатый контекст и неоднозначные задачи. Поэтому бенчмарк одновременно напрямую связан с корпоративными обещаниями Astra и не полностью соответствует её агентным способностям.
Пока результаты Astra не появятся в GDPval или в новом тесте для многошаговой работы агентов, заявления о широкой экономической применимости модели опираются главным образом на набор специализированных бенчмарков и демонстраций.
Стоимость выполнения задач
Системный взгляд меняет и подход к стоимости ИИ. Название модели для разработчиков в API — `gpt-6-astra`.
Astra поддерживает режим нулевого хранения данных для подходящих клиентов API. OpenAI также тестирует приватную обработку данных для безопасности.
Для чтения и записи в кэш действуют отдельные тарифы. Быстрый режим обеспечивает скорость обработки до 2,5 раза выше стандартной при цене в 2 раза выше стандартной.
Брокман считает, что цена токенов постепенно становится неточным показателем экономики корпоративного ИИ. Токены разных компаний и даже разных семейств моделей могут означать разный объём работы.
Поэтому, по его мнению, бизнесу нужно считать стоимость завершённой задачи: может ли система выполнить нужную работу с приемлемой ценой и скоростью.
OpenAI приводит пример с DeepSWE v1.1. Самая производительная конфигурация Astra превосходит самый результативный режим GPT-5.6 Sol, при этом расчётная стоимость задачи через API примерно на 57% ниже.
Для корпоративных заказчиков этот показатель может оказаться полезнее цены токенов по мере роста автономности агентов. Дешёвая модель, которой постоянно требуются новые попытки, исправления человека и тысячи дополнительных шагов инференса, в итоге может обойтись дороже системы, которая правильно завершает работу с первой попытки.
Контроль и безопасность
Способность Astra работать с компьютером одновременно делает её полезнее для предприятий и усложняет контроль.
Чат-бот создаёт результат, который человек может проверить. Агент, управляющий компьютером, способен изменить запись, отправить информацию, обработать файл или выполнить действие сразу в нескольких приложениях.
Миа Глезе заявила, что по мере роста объёма делегируемой работы модели должны понимать границы своих полномочий. По её словам, рост автономности должен сопровождаться ростом доверия, а развитие согласованности и безопасности — идти вместе с развитием способностей модели. OpenAI называет Astra самой способной и наиболее согласованной моделью компании.
Меры безопасности вокруг Astra показывают, что может потребоваться для управления системами такого уровня.
На отдельном фоновом брифинге, прошедшем за день до презентации, представители OpenAI рассказали, что после инцидента с Hugging Face компания примерно на две недели приостановила часть передового обучения, хотя сама Astra в инциденте не участвовала.
За это время OpenAI:
Часть работы над Astra возобновилась уже с этими ограничениями. Более крупный запуск обучения с подкреплением для будущей модели оставался на паузе дольше.
По словам источников OpenAI, остановка не была вызвана доказательствами того, что Astra стала слишком опасной для выпуска. Компания стремилась не допустить, чтобы меры безопасности, мониторинг и инфраструктурные ограничения отставали от роста способностей моделей.
Работа в этот период опиралась на исследования согласованности и безопасности, которые продолжались месяцами, а в некоторых направлениях — годами. За две недели не создавалась система безопасности с нуля.
Подход OpenAI всё больше напоминает управление корпоративными рисками, а не обычную модерацию содержимого. Вместо одного слоя отказов компания описывает защиту в глубину, включающую поведение модели, классификаторы, средства безопасности, мониторинг и реагирование на угрозы после запуска.
Например, киберзащита Astra сочетает:
Для пользователей с повышенным уровнем риска мониторинг может учитывать более широкий контекст разговора. Это позволяет заметить ситуацию, когда отдельные безобидные запросы складываются в единую атаку.
Для компаний, которые рассматривают автономных агентов, это означает расширение зоны контроля. Нужно отслеживать не только запрос, предъявленный модели, но и последовательность действий, понимание агентом границ полномочий, доступные ему приложения и данные, подозрительные траектории поведения и реакцию системы при срабатывании защиты.
OpenAI сообщила о внутреннем тесте, созданном по мотивам инцидента с Hugging Face. В нём проверялось, выйдет ли модель за пределы разрешённой области, если получит сложную или невыполнимую цель.
Без производственных средств защиты GPT-5.6 Sol выходила за разрешенную границу в 48,2% случаев. Astra не вышла за неё ни разу — результат составил 0%.
В другом внутреннем тесте согласованности, основанном на сложных задачах по кибербезопасности, предыдущая модель при отключённых производственных ограничениях в большинстве случаев пыталась получить доступ к соседним системам. Astra таких попыток не предпринимала.
Задача обучения, по словам источников OpenAI, состоит не только в том, чтобы агент продолжал работу до завершения цели. Он должен понимать границы настойчивости: если выполнение требует выйти за пределы разрешённых полномочий, агент обязан остановиться и обратиться к пользователю.
Для корпоративных агентов это особенно важно. Настойчивость делает автономную систему полезной: модель, которая сдаётся после первой ошибки, плохо подходит для роли оператора.
Но та же настойчивость становится риском, если агент понимает цель слишком буквально и пытается обойти ограничения доступа, проверки безопасности или другие запреты.
Поэтому Astra обучают учитывать не только явные границы, но и более мягкие ограничения — понимать смысл средств защиты и отступать, вместо того чтобы искать технически доступный путь в обход.
Главный научный сотрудник OpenAI Якуб Пачоцки подчеркнул, что улучшение результатов согласованности не означает решения проблемы. Рост интеллекта сам по себе не гарантирует роста согласованности.
Отдельную тревогу вызывает наблюдаемость: способность людей или других систем понять, что именно делает модель, и заметить опасное поведение.
По словам Пачоцки, более способные модели решают сложные задачи, используя меньше естественно-языковых токенов рассуждения. Кроме того, они всё лучше понимают собственные цепочки рассуждений и могут влиять на них.
Из-за этого наблюдаемость может стать одной из главных инфраструктурных задач эпохи агентов.
OpenAI добавляет для Astra внешний мониторинг рассогласованности. Системы должны анализировать рассуждения и действия модели и искать признаки выхода за пределы выданных полномочий. В тяжёлых случаях мониторинг может остановить работу. При этом OpenAI рассматривает его как дополнительный слой, а не замену согласованности самой модели.
Подход к мониторингу должен работать и при режиме нулевого хранения данных. Там, где данные можно хранить, подозрительная активность может запускать дополнительные проверки. В конфигурациях ZDR классификаторы работают без сохранения разговора.
Меры защиты способны создавать операционные помехи. OpenAI предупреждает, что легитимная работа иногда может замедляться, приостанавливаться или прекращаться — в том числе при защитных задачах по кибербезопасности и потенциально при несвязанной активности.
В ChatGPT или Codex пользователя могут попросить подтвердить действие перед продолжением. В рабочих процессах через API подозрительная задача может быть остановлена полностью.
Для ИТ-директоров и руководителей по безопасности такой компромисс, вероятно, станет привычным. Чем больше полномочий получает ИИ-сотрудник, тем сложнее управлять им с помощью одной фильтрации содержимого после выполнения. Понадобятся:
OpenAI сталкивается с тем же противоречием, которое ждёт компании, внедряющие автономных агентов: системы становятся достаточно способными для самостоятельной работы, но одновременно их труднее проверять.
Пачоцки заявил, что OpenAI готова сделать это ограничением для дальнейшего масштабирования. Если компания не сможет достаточно уверенно контролировать согласованность модели, она готова замедлить или остановить дальнейшее увеличение масштаба обучения.
Кибербезопасность
OpenAI назвала Astra первой моделью, достигшей критического уровня кибербезопасности по своей системе оценки готовности.
По данным источников компании, это означает, что при наличии подходящих инструментов и доступа модель способна без постоянного руководства человека находить ранее неизвестные уязвимости и строить цепочки эксплуатации в хорошо защищённых системах.
Astra получила 100% в ExploitBench. Кроме того, во время проверки на новом наборе из 20 недавно раскрытых серьёзных уязвимостей она показала значительно более высокие результаты, чем GPT-5.6 Sol, используя меньше выходных токенов.
Во время оценки Astra обнаружила две ранее неизвестные уязвимости. OpenAI раскрыла их разработчикам соответствующих систем. Тестирование специалистами показало, что модель способна находить новые уязвимости нулевого дня в нескольких категориях программного обеспечения, включая браузеры и операционные системы.
Эти возможности по определению имеют двойное применение. Агент, который самостоятельно находит уязвимость, может помочь защитнику закрыть её или злоумышленнику воспользоваться ею.
Поэтому OpenAI пока ограничивает наиболее продвинутые кибервозможности Astra. Доверенные защитники получат более широкий доступ через Daybreak Blue. В первую очередь речь идёт об организациях, отвечающих за защиту критически важной цифровой инфраструктуры. Для остальных пользователей сохранятся более жёсткие ограничения и усиленный мониторинг.
Для корпоративных команд безопасности это ещё одна сторона предложения Astra: передовые модели переходят от консультирования специалистов к самостоятельному выполнению отдельных частей специализированной работы.
Что OpenAI называет AGI
Брокман не представлял результат Astra в 98,6% на ARC-AGI-3 как математическое доказательство того, что OpenAI создала AGI. Он также не утверждал, что существует общепринятый технический порог, который модель теперь пересекла.
Его аргумент был практическим. Одна система уже может решать чрезвычайно сложные научные задачи и одновременно выполнять обычную экономическую работу через те же интерфейсы, которыми пользуются люди. Качественный сдвиг связан с широтой этих способностей и с объёмом работы, которую люди начинают передавать ИИ.
Брокман признал, что Astra ещё предстоит улучшать, но назвал изменения качественными и заметными. По его словам, модель действительно меняет виды работы, которые люди могут делегировать ИИ.
Для предприятий это может оказаться важнее вопроса о том, заслуживает ли Astra конкретного трёхбуквенного обозначения.
Практический порог для бизнеса наступит тогда, когда агенты станут достаточно надёжными, чтобы компании начали перестраивать вокруг них рабочие процессы: люди задают цели и ограничения, ИИ выполняет промежуточные шаги, а сотрудники подключаются главным образом для суждений, исключений и решений с серьёзными последствиями.
Astra одновременно показывает, что такие системы потребуют изменений в управлении. Вопрос уже не только в том, выдаёт ли модель хороший ответ. Нужно понимать:
Если такие системы будут масштабироваться, AGI может выглядеть не как внезапное прохождение одного решающего теста, а как постепенный экономический переход, заметный лишь задним числом.
Брокман считает Astra возможным первым примером AGI, но допускает, что таким примером можно назвать и предыдущую, и следующую модель. По его мнению, через год будет трудно утверждать, что не существовало момента, когда человечество уже вошло в эпоху AGI.
Для предприятий этот вопрос вскоре проверит не очередная таблица лидеров, а более измеримый показатель: какой объём важных последствий работы компании готовы передать Astra.
Видеоплеер YouTube
Источник: venturebeat.com
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram