Ранее несколько оценок, включая собственные тесты OpenAI, показывали, что Astra заметно обходит другие модели. При этом Artificial Analysis поставила её лишь на один уровень с предыдущей версией.
С обновлённым индексом GPT-6 Astra получила прирост в четыре балла по сравнению с предшественницей. Первые места теперь распределились так:
По данным Artificial Analysis, Astra расходует на одну задачу меньше токенов, чем любая другая передовая модель. В соотношении стоимости и результата первое место делят Anthropic, OpenAI, Meta и Zhipu ИИ.
В индекс добавили два новых бенчмарка:
Из индекса убрали GPQA-Diamond: модели уже решили этот тест, поэтому он перестал различать их возможности. Доля закрытых тестовых данных в итоговой оценке выросла до 40% — это должно усложнить накрутку результатов. Кроме того, Artificial Analysis исправила ошибки подсчёта в нескольких бенчмарках и изменила системы выставления оценок, чтобы результаты были стабильнее.
В Artificial Analysis объяснили, что раньше откладывали обновления, чтобы сохранять сопоставимость баллов во время крупных запусков моделей. Однако верхняя часть рейтинга стала меняться настолько быстро, что потребовалось промежуточное обновление.
Версия 5 находится в разработке уже восемь месяцев. Её будут выпускать поэтапно.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram