Что показала новая модель
Meta представила Muse Spark 1.3 вчера. По словам сооснователя и генерального директора компании Марка Цукерберга, модель получила «почти слишком дешёвую для подсчёта» производительность уровня передовых моделей и стала крупнейшим обновлением Meta в задачах по программированию и работе ИИ-агентов.
За этим заявлением стоят конкретные результаты. По сравнению с выпуском Muse Spark 1.2, который состоялся в прошлом месяце, новая модель заметно прибавила, особенно в долгих задачах с ИИ-агентами. Доступная разработчикам версия также вошла в число наиболее выгодных по соотношению цены и результатов среди лидеров независимых рейтингов.
Но лучшие показатели Muse Spark 1.3 относятся к конфигурации max. Meta сообщает, что она ещё проходит дополнительные проверки безопасности и появится «вскоре». Компания Artificial Analysis, проводящая независимые бенчмарки, тестировала max в ограниченном партнёрском предварительном доступе, однако сейчас не указывает ни одного поставщика API для этой конфигурации.
Широко распространяемая на этой неделе версия, доступная через оболочку Muse Code и API Meta Model, использует прежние настройки рассуждения Meta, включая xhigh.
Поэтому для компаний важнее не вопрос о том, способна ли Muse Spark 1.3 достичь уровня передовых моделей, а то, насколько близко к нему находится версия, которую компании могут развернуть уже сегодня, и во сколько это обойдётся на практике.
Meta публикует результаты обеих конфигураций в подробном отчёте об оценке, то есть версия для развертывания не скрыта. Но в материалах запуска компания заметно выделяет max, и именно ей принадлежат некоторые из самых высоких результатов.
Например, Meta приводит такие показатели:
На некоторых тестах разница минимальна или результат оказывается в пользу xhigh. В DeepSearchQA обе конфигурации набрали по 89,4. В Terminal-Bench 2.1 версия xhigh получила 89,2 против 88,8 у max.
Artificial Analysis оценила Muse Spark 1.3 max в 62 балла по своему индексу интеллекта, а доступную xhigh — в 61 балл. Последняя сравнялась с GPT-5.6 Sol max, Grok 4.6 high и Claude Opus 5 high.
Лидерство при этом сохраняет Anthropic. Claude Fable 5.1 набрала 66 баллов в конфигурации max и 65 в xhigh, а Claude Opus 5 получила по 63 балла в обеих конфигурациях.
Иными словами, Muse Spark 1.3 xhigh действительно находится в группе передовых моделей, но пока не задаёт планку для всего рынка.
Сравнение с Muse Spark 1.2
Это заметный шаг вперёд по сравнению с Muse Spark 1.2. В прошлом месяце VentureBeat писало, что Meta выпустила убедительного конкурента в задачах по программированию, который всё же обычно уступал лучшей модели Anthropic.
В Terminal-Bench 2.1 Muse Spark 1.2 получила 82,9%, тогда как Opus 5 набрала 86,7%. В других основных сравнениях по программированию, которые представила Meta, старая модель также оставалась позади Opus.
С Muse Spark 1.3 Meta уже не просто участвует в этом сравнении. В нескольких тестах по программированию и задачам ИИ-агентов модель поочерёдно обходит OpenAI и Anthropic и уступает им.
Meta также заявляет, что базовой моделью стало проще управлять. Muse Spark 1.3 обучена:
Во внутренних сравнениях инженеров Meta модель использовала примерно на 20% меньше вызовов инструментов и на 25% меньше токенов, чем Muse Spark 1.2, во время работы над задачами по программированию.
Для компаний, которые оплачивают тысячи или миллионы циклов работы ИИ-агентов, такие изменения поведения могут оказаться важнее ещё одного балла в рейтинге.
Цена токенов и реальная стоимость
Meta не снизила цену API для Muse Spark 1.3. Тариф «Стандартный» остался на уровне Muse Spark 1.2:
Поэтому фраза Цукерберга о том, что модель «почти слишком дёшева для подсчёта», скорее говорит не о снижении цены токенов, а о том, какой объём работы, по мнению Meta, разработчики смогут выполнять за эти деньги.
Данные Artificial Analysis частично подтверждают такой подход, но одновременно показывают другую сторону. По её оценке, Muse Spark 1.3 xhigh генерирует 235,2 выходного токена в секунду, а средняя стоимость задачи в индексе интеллекта составляет $0,55.
При результате в 61 балл это самая низкая стоимость задачи среди всех моделей, которые Artificial Analysis сейчас измеряет на таком уровне интеллекта.
Muse Spark 1.2 обходилась Artificial Analysis в $0,40 за задачу, но получала только 57 баллов. Таким образом, при неизменной цене отдельных токенов стоимость выполнения средней задачи по независимому бенчмарку выросла по сравнению с предыдущим поколением.
Artificial Analysis связывает это прежде всего с тем, что в агентных тестах новая модель расходует больше входных токенов.
Это напрямую не противоречит заявлению Meta о сокращении использования токенов на 25%. Meta сравнивает собственные рабочие процессы по программированию, а Artificial Analysis проверяет более широкий набор задач на рассуждение и работу ИИ-агентов.
Ситуация показывает, почему слово «дёшево» становится расплывчатым, когда модели работают как ИИ-агенты. На итоговую стоимость влияют тарифы на токены, интенсивность рассуждения, число ходов диалога, вызовы инструментов и повторные попытки.
Meta также сохранила необычно дешёвый тариф «Для участников»:
Взамен компания получает разрешение использовать запросы и ответы для обучения.
Как VentureBeat отмечало в материале о Muse Spark 1.2, такой вариант может быть удобен для создания прототипов, но для компаний с закрытым кодом или чувствительными внутренними данными он требует другого подхода к управлению данными.
Сравнение с Google Gemini
Главный директор Meta по ИИ Александер Ван высказался о запуске заметно более резко.
После публикации результатов Muse Spark Artificial Analysis Ван разместил их у себя в X и добавил вопрос: «Gemini, кто?»
Эта реплика прозвучала особенно остро, потому что в тот же день Google выпустила Gemini 3.8 Flash. Компания позиционирует её примерно для тех же задач: долгой разработки программного обеспечения, автономных ИИ-агентов и многошагового профессионального рассуждения.
Google называет Gemini 3.8 Flash своей лучшей Flash-моделью для рассуждения и программирования. Это уже третий выпуск Flash компании за шесть недель.
Независимые цифры дают Вану основания для такого сравнения, хотя о разгромной победе речи нет. Artificial Analysis оценила Muse Spark 1.3 xhigh в 61 балл по индексу интеллекта при стоимости $0,55 за задачу. Gemini 3.8 Flash в режиме усиленного рассуждения получила 59 баллов при цене $0,58 за задачу.
На этих настройках Meta немного опережает Google и по интеллекту, и по стоимости выполнения задачи.
Зато Google заметно выигрывает в скорости генерации. Artificial Analysis измерила у Gemini 3.8 Flash около 305 выходных токенов в секунду против 235 у Muse Spark — примерно на 30% больше.
Сейчас у Gemini ниже и базовая цена API по рекламному тарифу:
Промо-тариф Google действует до 31 декабря. После этого цена вырастет до $1,50 за миллион входных токенов и $7,50 за миллион выходных.
Сравнение показывает, насколько плотной стала экономика передовых моделей. В этом независимом тесте Meta выигрывает у Google два балла по индексу интеллекта и три цента по стоимости задачи. Google предлагает заметно более высокую скорость генерации и более дешёвые токены на время запуска.
Для архитектора корпоративной системы ответ на реплику Вана выглядит так: Gemini сейчас быстрее, а Muse по этому независимому измерению немного сильнее как ИИ-агент с высоким уровнем рассуждения.
Неясная судьба открытой версии
Для части разработчиков более важным может оказаться вопрос, который почти не связан с сегодняшним соревнованием бенчмарков.
Когда Meta запустила Muse Code и Muse Spark 1.2 в августе, VentureBeat обратило внимание на то, насколько компания отошла от стратегии открытых моделей, благодаря которой Llama получила широкое распространение.
Muse Code и Spark 1.2 стали закрытыми продуктами с доступом через API. Для компании, которая много лет продвигала открытый ИИ как основной путь развития, это был заметный поворот.
Через пять дней Meta снова изменила курс.
10 августа компания выпустила Muse Glimmer с 30 миллиардами параметров под лицензией Apache 2.0. Цукерберг также заявил, что «в ближайшие недели» Meta откроет веса Muse Spark 1.2. Reuters отдельно сообщило о планах Meta выпустить веса Spark 1.2.
Теперь Meta представила Muse Spark 1.3 как ещё одну закрытую модель.
Это пока не означает, что обещание нарушено: формулировка «в ближайшие недели» может описывать период дольше трёх недель. Но новый запуск сделал планы компании менее ясными.
В новой публикации Meta больше не упоминается Muse Spark 1.2. Вместо этого компания говорит, что её дорожная карта включает «выпуск открытых весов Muse Spark», не называя версию, дату выпуска, размер модели или лицензию. Цукерберг также написал в X, что «выпуски открытых весов Muse Spark» появятся скоро.
Для команд, которые выбрали Llama именно из-за возможности скачать веса, развернуть модель на своих серверах, настроить её и контролировать экономику инференса, такая неопределённость может быть важнее ещё одного балла в сводном бенчмарке.
Muse Spark 1.3 показывает, что Meta научилась быстро обновлять закрытые модели уровня передовых систем. Доступная конфигурация xhigh работает быстро, конкурентоспособна по цене и заметно приблизилась к вершине независимых рейтингов по сравнению с предшественниками. Предварительная версия max показывает, что Meta способна продвинуть семейство ещё дальше, если выделить больше вычислительных ресурсов на рассуждение.
Теперь компании предстоит решить другую задачу: превратить этот темп в понятную дорожную карту, на которую предприятия смогут планировать работу. В неё входят широкая доступность лучших возможностей модели и выпуск открытой версии Muse Spark, о котором Meta уже заявляла.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram