i
ДАТАИСТ
Новости · 2026-09-04

Бенчмарки спорят о GPT-6 Astra, но ARC-AGI-3 сдвигает прогноз Шолле по AGI

@neuronium_ai @neuronium_ai

Новая модель OpenAI GPT-6 Astra получила противоположные оценки на разных бенчмарках. Epoch ИИ поставила её на первое место среди 267 моделей с результатом 169 баллов, тогда как Artificial Analysis дала Astra 61 балл — столько же, сколько предшественнице, — и поставила ниже Claude Fable 5.1 с 66 баллами. Главный результат пришёлся на ARC-AGI-3: Astra впервые прошла игровые задачи эффективнее среднего человека, набрав 62,7% против 7,78% у GPT-5.6 Sol и 30,16% у Claude Opus 5. Франсуа Шолле, руководитель ARC Prize, считает, что модель появилась примерно вдвое раньше ожидаемого и из-за ускорения прогресса сдвинул прогноз AGI на более ранний срок.

Обложка: Бенчмарки спорят о GPT-6 Astra, но ARC-AGI-3 сдвигает прогноз Шолле по AGI

Противоречивые оценки

Две независимые лаборатории объединили результаты десятков отдельных тестов в общий балл, но пришли к разным выводам.

Epoch ИИ — более 50 бенчмарков, 169 баллов для GPT-6 Astra и первое место среди 267 моделей.
Artificial Analysis — тесты знаний, программирования и понимания текста; Astra получила 61 балл, сравнявшись с предшественницей и уступив Claude Fable 5.1 с 66 баллами.

Astra заметно дороже собственной предшественницы. OpenAI берёт за единицу обработанного текста в 2,5 раза больше, поэтому выполнение задачи обходится примерно на 75% дороже, чем с Sol. В сравнении с Anthropic картина обратная: на задачах по программированию Astra набирает столько же, сколько Claude Fable 5, но одна задача стоит менее половины аналогичной у конкурента. Причина — экономичность модели: ей требуется лишь треть вычислительных шагов Sol и пятая часть объёма, необходимого Opus 5.

GPT-6 Astra против Solв 2,5 раза дороже за единицу текста
GPT-6 Astra против Opus 5пятая часть вычислительных шагов

В индексе агентов для программирования Astra набрала 67 баллов, используя примерно треть токенов Sol. Fable 5.1 лидирует с 70 баллами. Доля галлюцинаций в AA-Omniscience снизилась с 92 до 51%. При этом Astra потеряла около 80 баллов Эло в GDPval-AA v2 и показала более слабые результаты в поддержке банковских клиентов, SciCode и задачах на рассуждение в длинном контексте.

Сноска к результатам уточняет, что GPT-6 Astra тестировалась с очень высоким уровнем рассуждения: на максимальном уровне она достигает 97,5%. ARC-AGI-1 теперь считают в основном насыщенным бенчмарком.

Математика и программирование

По данным Epoch ИИ, в новом FrontierMath Erdős GPT-6 Astra стала единственной моделью, которая решила две из 68 открытых задач Эрдёша с доказательствами, проверенными в Lean. На каждую попытку выделялось до 300 долларов.

Ещё три решения были получены в дополнительных нестандартизированных запусках. На них потратили более 220 000 долларов вычислительных ресурсов, но Epoch ИИ не включает эти результаты в общий счёт.

Если посмотреть на отдельные показатели Epoch ИИ, Astra и Fable 5.1 пока сравнивались не на одинаковой основе. Astra лидирует в математике, знаниях и головоломках, а Fable 5.1 получает лучшие результаты почти во всех тестах по программированию. При этом для Astra у Epoch ИИ зафиксирован только один результат в программировании — запуск на среднем уровне рассуждения.

Результат ARC-AGI-3

Самый заметный скачок Astra показала в ARC-AGI-3. В этом тесте ИИ помещают в незнакомые игровые миры, не объясняя правила и цели. Модель должна понять, что делать, методом проб и ошибок.

GPT-6 Astra — 62,7%, стоимость теста около 26 000 долларов.
GPT-5.6 Sol — 7,78%.
Claude Opus 5 — 30,16%.
Fable 5 и Fable 5.1 — пока не участвовали в бенчмарке.

Заявленные OpenAI 99,9% были получены в других условиях. Astra использовала созданную OpenAI тестовую оболочку, которая сохраняет цепочки рассуждений между отдельными запросами и автоматически сжимает длинные запуски. По измерениям ARC Prize, такие запуски проходили примерно в 3,66 раза быстрее и требовали на 49% меньше токенов, чем запуски на внутренней оболочке. Сравнение проводилось на 167 парах игровых задач, которые смогли решить обе системы.

Тестовые оболочки и связанный с ними рост результатов уже становились причиной разногласий между ARC Prize и OpenAI во время оценки GPT-5.6 Sol. ARC Prize подчёркивает, что только показатель 62,7%, полученный на внутреннем каркасе ARC, позволяет честно сравнивать модели разных разработчиков. В будущем организация планирует публиковать и результаты на оболочках самих компаний.

Рассуждение снижает стоимость

Связь между уровнем рассуждения и стоимостью запуска у Astra необычна. Обычно более глубокое рассуждение делает тест дороже. Здесь происходит обратное: на стандартном каркасе ARC стоимость снижается с 49 791 доллара без рассуждения до 26 098 долларов на максимальном уровне, а результат растёт с 35,2 до 62,7%.

ARC Prize объясняет это тем, что Astra решает игры за меньшее число ходов. Поэтому модель делает меньше вызовов и использует меньше токенов. При этом уровень «низкий» дал 17,5% — хуже, чем запуск вообще без рассуждения. ARC Prize не объясняет этот результат. В других бенчмарках Astra уже показывала способность решать задачи с длинной цепочкой действий без отдельного рассуждения: вероятно, новая архитектура сама выполняет часть обработки до генерации первого токена.

Для сравнения, люди-тестировщики получали 115 долларов за 90-минутную сессию и ещё 5 долларов за каждую решённую игру. При примерно девяти попытках это даёт около 12,78 доллара за игру. Но в основном такая сумма оплачивает время и готовность участвовать. Если учитывать только электричество, необходимое для метаболической работы мозга, ARC Prize оценивает стоимость человеческого решения в 0,067 цента за игру.

Эффективность прохождения

Организаторов больше интересует не только итоговый балл, но и эффективность. До запуска ARC Prize предложила примерно 500 тестировщикам сыграть без предварительного отбора и для каждого уровня зафиксировала медианное число ходов среди тех, кто его решил.

При запуске на оболочке OpenAI Astra прошла 96% уровней за меньшее число ходов, чем медиана людей. В среднем ей требовалось чуть больше половины человеческого числа ходов.

Обычные показатели стоимости отслеживают объём вычислений. Здесь измеряется другое: сколько опыта взаимодействия со средой модели понадобилось, чтобы освоить её.

Именно в этой области организаторы рассчитывали на устойчивое преимущество людей. Для подходов с перебором оно сохраняется, но у передовых моделей ARC Prize видит почти бинарную картину: когда модель понимает механику игры, её выполнение задачи попадает в диапазон человеческой эффективности.

Собственная система обозначений

Чтобы решать задачи, Astra ведёт собственные записи и придумывает компактную алгеброподобную систему обозначений. В ней модель фиксирует объекты, координаты, правила и незавершённые планы. Например, запись `extend8 to3; retract10 to2` описывает последовательность ходов, а `Turn 5: P=(24,20), empty, facing west` — состояние игры.

ARC Prize наблюдала похожее поведение и у других моделей, но отдельно отметила точность и высокую плотность информации в записях Astra. На стандартном каркасе это особенно важно: всё, что модель не сохранила в видимых заметках, для неё фактически теряется.

Сооснователь ARC Prize Франсуа Шолле описал поведение Astra как эффективное символическое моделирование мира на лету для каждой игры и каждого уровня. По его словам, модель сама создаёт сокращённый язык описания игровых ситуаций — фактически специальную алгебраическую запись для конкретной игры.

Для Шолле важно, откуда появилась эта способность: раньше подобное символическое моделирование удавалось увидеть только при использовании сложных тестовых оболочек. Теперь, считает он, возможности оболочек всё чаще перемещаются непосредственно в модель.

Внешние инструменты

Третья тестовая среда показывает, чего Astra добивается с внешними инструментами. PRO-LONG — среда для ИИ-агентов, созданная сторонней командой. ARC Prize заранее развернула её как партнёра для поиска уязвимостей ARC-AGI-3 и систематического изучения пределов бенчмарка.

В отличие от стандартной настройки, модель получила песочницу, где могла выполнять собственный код. Astra воспользовалась этим и написала для каждой игры небольшие библиотеки:

разборщики игрового поля;
модели состояния;
алгоритмы поиска;
планировщики.

В игре-лабиринте со стражами модель последовательно создала поиск пути, модуль боевых правил, модель перемещений патрулей и программу, которая постоянно сопоставляла собственные прогнозы с наблюдениями.

ARC Prize не заметила попыток выбраться из песочницы. Эти результаты нельзя напрямую сравнивать с человеческими: у тестировщиков не было ни интерпретатора кода, ни блокнота. Здесь измеряется совместная работа модели и созданных ею инструментов.

Это не доказательство AGI

ARC Prize прямо не считает эти результаты свидетельством общего искусственного интеллекта. Франсуа Шолле подчёркивает, что пока о системе известно только то, как она показывает себя на бенчмарках.

При запуске ARC-AGI-3 организаторы отдельно повторяли: решение теста не доказывает наличие AGI и сам бенчмарк не задуман как финальная точка. Он проверяет качественные свойства, которые ожидают от системы общего ИИ:

исследование в условиях неопределённости;
адаптацию без инструкций;
причинное моделирование мира по небольшому объёму данных.

Но делает это в небольшом масштабе. Игры проходятся за промежутки времени, на порядки меньшие, чем реальные задачи, поэтому требуют меньше данных, меньшей сложности моделирования и меньшего обучения на лету.

Прогноз Франсуа Шолле

Около шести месяцев назад, после выхода ARC-AGI-3, Франсуа Шолле оценивал срок насыщения бенчмарка примерно в один год — в зависимости от того, насколько целенаправленно разработчики будут под него оптимизироваться.

Появление Astra произошло примерно вдвое быстрее этого прогноза. Шолле считает, что темпы прогресса могут удивить многих, а возможности новых моделей заставят пересмотреть представления об ИИ, сформированные предыдущими поколениями систем.

На вопрос, сохраняется ли его прежний прогноз AGI на 2030 год, Шолле ответил, что срок стоит сдвинуть на более ранний: прогресс идёт быстрее, чем он ожидал.

Следующий бенчмарк

ARC Prize уже разрабатывает ARC-AGI-4. По словам Шолле, работа началась после выпуска ARC-AGI-3, а публикация запланирована на первый квартал 2027 года.

Бенчмарки развиваются вместе с моделями и каждый раз нацелены на оставшийся разрыв между ИИ и человеческим интеллектом. В ARC Prize считают ARC-AGI-3 ограниченным тестом: в нём детерминированная механика, закрытые цели и нет представления об открытом реальном мире.

Следующее поколение должно, среди прочего, изучать рекурсивное самосовершенствование и открытые инновации.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram