Muse Spark 1.3 доступна через Muse Code и API моделей Meta. Серия стартовала в апреле, затем в июле вышла версия 1.1, а в августе — 1.2. Сейчас пользователям доступен уровень xhigh. Более требовательный к вычислениям max появится после дополнительных проверок безопасности; пока он работает в ограниченном предварительном доступе для партнёров, сообщает Artificial Analysis.
Цена не изменилась: $1.25 за миллион входных токенов и $4.25 за миллион выходных. Один тест из набора Intelligence Index обходится в $0.55. Среди моделей с результатом от 59 баллов более дешёвых вариантов нет. Модели с сопоставимым результатом стоят от $0.94 до $1.23 за такой тест. При этом Muse Spark 1.3 всё же дороже предыдущей версии 1.2, для которой стоимость составляла $0.40.
В Intelligence Index вариант max набрал 62 балла, а xhigh — 61. В августе результат версии 1.2 составлял 57 баллов, в июле — 53. Рост во многом связан с весами отдельных тестов: GDPval-AA v2 даёт 20% итоговой оценки, Terminal-Bench 2.1 — 16%, а τ³-Bench Banking — 14%. Именно в этих трёх тестах Meta добилась наиболее заметного прогресса.
В τ³-Bench Banking ИИ-агенты используют инструменты в смоделированном банковском сценарии. Вариант max набрал 52% — это первое место на текущий момент по данным Artificial Analysis и единственный тест, где модель уверенно лидирует. Доступный уровень xhigh достиг 47% и сравнялся с Claude Fable 5.1 (max) и GLM-5.3-Flash, но не превзошёл их. У Muse Spark 1.2 было 35%.
В Terminal-Bench 2.1 проверяется программирование в терминале. Результат xhigh вырос с 80 до 85%, а max достиг 86%. Однако Claude Fable 5.1 сохраняет лидерство: её max набрал 91,4%, xhigh — 91,0%, high — 89,9%.
В тесте GDPval-AA v2 с наибольшим весом Meta улучшила результат с 1615 до 1709 у xhigh и 1754 у max. Шкала откалибрована по уровню работы людей-экспертов: 1000 баллов соответствуют их результатам в 220 реальных профессиональных задачах. Claude Fable 5.1 (max) получила 1853. Преимущество версии max достигается за счёт вычислений: она использует на 62% больше токенов рассуждения, чем xhigh.
Источник: the-decoder.com
В GPQA Diamond, где задаются научные вопросы экспертного уровня, Muse Spark поднялась с 90 до 94%. Это результат в группе лидеров, но ниже показателей Gemini 3.8 Flash (high) с 95,3% и Grok 4.6 (high) с 94,9%. В CritPt, тесте по исследовательской физике, рост оказался заметнее — с 18 до 26%. При этом модель отстаёт от GPT-5.6 Sol (max), набравшей 32,3%, и Claude Fable 5.1 (xhigh) с 31,1%.
По двум показателям Muse Spark 1.3 уступила версии 1.2. Результат AA-LCR снизился с 83 до 79%. В AA-Omniscience фактическая точность упала максимум на три пункта: модель стала чаще отказываться отвечать, если не уверена в ответе.
Meta и Artificial Analysis пока не назвали цену варианта max. В будущем должны выйти более крупные модели и версия с открытыми весами.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram