i
ДАТАИСТ
Новости · 2026-09-05

Artificial Analysis переработала Intelligence Index после скепсиса к оценке GPT-6 Astra

@neuronium_ai @neuronium_ai

Artificial Analysis выпустила версию 4.2 своего индекса интеллекта после критики: прежняя система оценки поставила GPT-6 Astra примерно на один уровень с предшественником, хотя другие проверки показали заметный прогресс модели. В рейтинге Epoch ИИ Astra заняла первое место среди 267 моделей, набрав 169 баллов более чем в 50 бенчмарках, а ARC-AGI-3 зафиксировал большой или очень большой скачок — в зависимости от использованной тестовой оболочки. В новой версии Astra опережает предшественницу на четыре балла, но уступает Claude Fable 5.1 и занимает второе место.

Обложка: Artificial Analysis переработала Intelligence Index после скепсиса к оценке GPT-6 Astra

Ранее несколько оценок, включая собственные тесты OpenAI, показывали, что Astra заметно обходит другие модели. При этом Artificial Analysis поставила её лишь на один уровень с предыдущей версией.

С обновлённым индексом GPT-6 Astra получила прирост в четыре балла по сравнению с предшественницей. Первые места теперь распределились так:

1Claude Fable 5.1 от Anthropic.
2GPT-6 Astra от OpenAI.
3Модель Meta.

По данным Artificial Analysis, Astra расходует на одну задачу меньше токенов, чем любая другая передовая модель. В соотношении стоимости и результата первое место делят Anthropic, OpenAI, Meta и Zhipu ИИ.

В индекс добавили два новых бенчмарка:

AA-Briefcase — проверка знаний и навыков, необходимых для работы с реальными задачами.
GDP.pdf от Surge ИИ — анализ документов в формате PDF.

Из индекса убрали GPQA-Diamond: модели уже решили этот тест, поэтому он перестал различать их возможности. Доля закрытых тестовых данных в итоговой оценке выросла до 40% — это должно усложнить накрутку результатов. Кроме того, Artificial Analysis исправила ошибки подсчёта в нескольких бенчмарках и изменила системы выставления оценок, чтобы результаты были стабильнее.

В Artificial Analysis объяснили, что раньше откладывали обновления, чтобы сохранять сопоставимость баллов во время крупных запусков моделей. Однако верхняя часть рейтинга стала меняться настолько быстро, что потребовалось промежуточное обновление.

Версия 5 находится в разработке уже восемь месяцев. Её будут выпускать поэтапно.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram