i
ДАТАИСТ
Новости · 2026-09-04

Meta: Muse Voice Transcribe — $0,18/ч за диаризацию 20+ говорящих. Выгодно ли бизнесу?

@neuronium_ai @neuronium_ai

Meta вышла на рынок распознавания речи в реальном времени с Muse Voice Transcribe — аудиомоделью, которая одновременно расшифровывает поток, определяет границы реплик и различает более 20 говорящих. Публичный API стоит $0,18 за час обработанного аудио. Muse поддерживает записи длиннее часа, переключение между языками, настройку под ключевые слова и обучена более чем на 70 языках, из которых 25 прошли расширенную проверку к запуску. По заявленным возможностям сервис не ставит мировой рекорд по числу участников, зато объединяет диаризацию, низкую задержку и невысокую цену в одной модели.

Обложка: Meta: Muse Voice Transcribe — $0,18/ч за диаризацию 20+ говорящих. Выгодно ли бизнесу?

Что умеет Muse

Muse Voice Transcribe разработала Meta Superintelligence Labs. Модель обрабатывает речь по мере поступления, не дожидаясь окончания записи. Meta заявляет поддержку:

аудио продолжительностью более часа;
плавного переключения между языками;
языкового смещения и настройки под ключевые слова;
диаризации без отдельного конвейера постобработки;
более 20 говорящих в одной сессии.

Число участников заметное, но не рекордное. Speechmatics заявляет распознавание 50 говорящих по умолчанию и до 100 при увеличении лимита. Amazon Transcribe указывает максимум в 30 уникальных говорящих, в том числе для потоковой расшифровки.

Muse занимает верхнюю часть рынка по вместимости, но предложение Meta строится не только вокруг количества участников. В одной модели объединены диаризация с большой ёмкостью, расшифровка с низкой задержкой, определение границ реплик, переключение между языками и агрессивная цена API.

Для корпоративных разработчиков, которые создают системы для встреч, аналитику звонков, голосовых помощников или фоновые ИИ-сервисы, такая комбинация может оказаться важнее самого высокого лимита говорящих.

Зачем нужна диаризация

Обычная система распознавания речи отвечает на вопрос «что сказали?». Диаризация добавляет второй: «кто это сказал?».

Это особенно важно, когда расшифровки передаются другим ИИ-системам. Помощник для встреч может без ошибок распознать каждое предложение, но создать ненадёжную корпоративную запись, если припишет согласование, обязательство или возражение не тому участнику. Та же проблема возникает в аналитике клиентской поддержки, процессах контроля соответствия и ИИ-агентах, работающих в помещениях с несколькими собеседниками.

Meta встроила определение говорящих непосредственно в авторегрессионную мультимодальную архитектуру Muse. Аудио поступает блоками по 80 миллисекунд — это 12,5 блока в секунду, — после чего каждый блок превращается в мягкий токен. На каждом шаге модель решает, принять ли ещё аудио или уже выдать текст.

Meta называет этот механизм адаптивной задержкой. Muse может подождать дольше, если речь неоднозначна, и раньше зафиксировать результат, когда контекста достаточно. Для обучения такого поведения Meta использовала обучение с подкреплением, объединив награды за долю ошибок в словах и за задержку.

Определение говорящих и границ реплик тоже включено в общую последовательность токенов:

`<|start_of_turn|>` отмечает возможное начало новой реплики;
`<|speaker_A|>` и похожие токены указывают говорящего;
отдельные токены начала и конца фиксируют границы речи.

Meta обучает распознавание речи, диаризацию и определение границ реплик вместе, а не запускает кластеризацию говорящих как отдельный процесс после расшифровки.

В документации API моделей диаризация представлена как самостоятельный режим работы наряду с активацией по кнопке и определением границ реплик. Метки вроде A и B относятся к конкретной сессии и не подтверждают личность участников. API выдаёт временные отметки для реплик, но не для отдельных слов.

Сравнение с конкурентами

Сопоставлять число говорящих напрямую нужно осторожно: поставщики реализуют диаризацию по-разному и не всегда публикуют максимальный лимит.

Speechmatics — поддерживает диаризацию в реальном времени, 50 говорящих по умолчанию и до 100 при увеличении лимита.
Amazon Transcribe — различает до 30 уникальных говорящих и предоставляет отдельные инструкции для разделения участников в потоковой расшифровке.
Soniox — поддерживает диаризацию в реальном времени и при отложенной обработке, максимум — 15 говорящих в сессии.
AssemblyAI — позволяет задать параметр `max_speakers` от одного до 10.
xAI Speech-to-Text API — поддерживает диаризацию в потоковом режиме, но в просмотренной документации не указывает максимальное число говорящих.

Soniox и AssemblyAI отдельно предупреждают, что в реальном времени определять участников сложнее: потоковая система принимает решения, имея меньше будущего аудиоконтекста, чем модель для готовой записи.

Поэтому называть Muse мировым рекордсменом по числу говорящих было бы неправильно. Самый высокий явно опубликованный лимит среди рассмотренных сервисов принадлежит Speechmatics — до 100 участников.

Сама Meta не показала 20 и более одновременных участников в материалах к запуску. В основной демонстрации участвуют восемь говорящих, а в длинной записи размечены 11 участников. Число «более 20» — заявленная способность модели, а не количество людей в публичных демонстрациях.

Цена API

Muse Voice Transcribe стоит $3 за 1 000 минут, то есть $0,18 за час. Потоковая и непотоковая расшифровка тарифицируются одинаково. Meta также утверждает, что обработка с нулевым хранением данных стоит столько же, сколько стандартный режим.

Оплата начисляется только за фактически обработанное аудио и округляется вниз до целых секунд.

Сравнение опубликованных тарифов осложняется разными условиями у поставщиков:

Qwen — международный тариф для работы в реальном времени составляет $0,00009 за секунду, или около $0,324 за час.
Google Gemini — указанная стоимость представляет собой расчётную смешанную цену токенов, а не фиксированный почасовой тариф.
AWS — цена зависит от региона и уровня использования; в примере для Северной Вирджинии потоковая обработка стоит около $0,60 за час.
ElevenLabs — $0,39 за час по тарифам API и $0,28 за час или меньше на годовых корпоративных планах.
Deepgram — потоковая расшифровка Nova-3 Multilingual стоит около $0,35 за час, а диаризация добавляет $0,002 за минуту; сопоставимая итоговая цена — примерно $0,47 за час.
AssemblyAI — $0,45 за час для Universal-3.5 Pro Realtime и ещё $0,12 за час за потоковую диаризацию.
Cartesia — тариф Ink-2 продаётся через месячные пакеты кредитов. План Pro за $5 включает примерно девять часов и 16 минут расшифровки, что даёт около $0,54 за час, если потратить все кредиты только на распознавание речи.

Последнюю цифру нельзя напрямую считать самостоятельным почасовым тарифом API: она рассчитана из месячного пакета.

Muse не стала самым дешёвым сервисом потоковой расшифровки — Soniox сейчас публикует более низкую эквивалентную цену. Но $0,18 за час с уже включённой диаризацией выводят Meta в нижнюю часть рынка, особенно на фоне поставщиков, которые берут отдельную плату за определение говорящих.

При обработке 1 000 часов аудио по публичному тарифу Meta счёт составит примерно $180.

$0,18стоимость часа Muse
1 000минут в базовом тарифе
$180обработка 1 000 часов

Точность распознавания

Низкая цена имеет смысл только при отсутствии серьёзной потери точности. В материалах Meta приводятся противоположные результаты.

В индексе потокового распознавания Artificial Analysis AA-WER Muse получила показатель ошибки в словах 3,1%. Далее идут:

Cartesia Ink-2 — 3,4%;
ElevenLabs Scribe v2 Realtime — 3,6%;
Qwen3 ASR Flash Realtime — 3,7%;
GPT Live Transcribe — 3,9%;
Grok Speech to Text Streaming — 3,9%;
Gemini 3.5 Transcribe Live — 4,0%;
AssemblyAI U3.5 Realtime Pro — 4,0%.

Meta указывает, что по состоянию на 1 сентября Muse занимала первое место в потоковом бенчмарке Artificial Analysis — независимой сторонней компании, которая проводит оценку ИИ-систем.

Отдельно Meta приводит результат по диаризации. Средний показатель ошибки составил 17,5% на наборах AMI-IHM, AMI-SDM и VoxConverse — ниже, чем у конкурирующих систем, представленных на графике Meta.

Количество поддерживаемых говорящих и ошибка диаризации — разные показатели. Система, способная представить 100 участников, не обязательно точнее определяет, кому принадлежит конкретная реплика, чем система с лимитом в 20 человек. Кроме того, бенчмарк Meta не проверяет всех конкурентов на их заявленном максимальном количестве участников.

Ограничения

У Muse есть и ограничения, которые нужно учитывать при внедрении:

API выдаёт временные отметки для реплик, но не для отдельных слов;
оценки уверенности для отдельных слов недоступны;
нет определения звуковых событий;
нет определения эмоций;
по умолчанию поддерживается восемь одновременных потоков на одного клиента;
длительность сессии в реальном времени ограничена 60 минутами, после чего приложению нужно подключиться заново.

Вывод

Muse не установила мировой рекорд по числу говорящих, но это не единственный показатель для потоковой системы. Для корпоративных разработчиков важнее, сможет ли сервис одновременно сохранять правильную атрибуцию участников, точный текст и пригодные для работы границы реплик во время сложного разговора.

При цене $0,18 за час и диаризации более чем для 20 говорящих в той же модели Meta предлагает новый вариант для систем анализа встреч, расшифровки в реальном времени и инфраструктуры голосовых ИИ-агентов. При этом конкурентам придётся учитывать не только точность распознавания речи, но и качество определения говорящих вместе с общей стоимостью эксплуатации.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram