Что умеет Muse
Muse Voice Transcribe разработала Meta Superintelligence Labs. Модель обрабатывает речь по мере поступления, не дожидаясь окончания записи. Meta заявляет поддержку:
Число участников заметное, но не рекордное. Speechmatics заявляет распознавание 50 говорящих по умолчанию и до 100 при увеличении лимита. Amazon Transcribe указывает максимум в 30 уникальных говорящих, в том числе для потоковой расшифровки.
Muse занимает верхнюю часть рынка по вместимости, но предложение Meta строится не только вокруг количества участников. В одной модели объединены диаризация с большой ёмкостью, расшифровка с низкой задержкой, определение границ реплик, переключение между языками и агрессивная цена API.
Для корпоративных разработчиков, которые создают системы для встреч, аналитику звонков, голосовых помощников или фоновые ИИ-сервисы, такая комбинация может оказаться важнее самого высокого лимита говорящих.
Зачем нужна диаризация
Обычная система распознавания речи отвечает на вопрос «что сказали?». Диаризация добавляет второй: «кто это сказал?».
Это особенно важно, когда расшифровки передаются другим ИИ-системам. Помощник для встреч может без ошибок распознать каждое предложение, но создать ненадёжную корпоративную запись, если припишет согласование, обязательство или возражение не тому участнику. Та же проблема возникает в аналитике клиентской поддержки, процессах контроля соответствия и ИИ-агентах, работающих в помещениях с несколькими собеседниками.
Meta встроила определение говорящих непосредственно в авторегрессионную мультимодальную архитектуру Muse. Аудио поступает блоками по 80 миллисекунд — это 12,5 блока в секунду, — после чего каждый блок превращается в мягкий токен. На каждом шаге модель решает, принять ли ещё аудио или уже выдать текст.
Meta называет этот механизм адаптивной задержкой. Muse может подождать дольше, если речь неоднозначна, и раньше зафиксировать результат, когда контекста достаточно. Для обучения такого поведения Meta использовала обучение с подкреплением, объединив награды за долю ошибок в словах и за задержку.
Определение говорящих и границ реплик тоже включено в общую последовательность токенов:
Meta обучает распознавание речи, диаризацию и определение границ реплик вместе, а не запускает кластеризацию говорящих как отдельный процесс после расшифровки.
В документации API моделей диаризация представлена как самостоятельный режим работы наряду с активацией по кнопке и определением границ реплик. Метки вроде A и B относятся к конкретной сессии и не подтверждают личность участников. API выдаёт временные отметки для реплик, но не для отдельных слов.
Сравнение с конкурентами
Сопоставлять число говорящих напрямую нужно осторожно: поставщики реализуют диаризацию по-разному и не всегда публикуют максимальный лимит.
Soniox и AssemblyAI отдельно предупреждают, что в реальном времени определять участников сложнее: потоковая система принимает решения, имея меньше будущего аудиоконтекста, чем модель для готовой записи.
Поэтому называть Muse мировым рекордсменом по числу говорящих было бы неправильно. Самый высокий явно опубликованный лимит среди рассмотренных сервисов принадлежит Speechmatics — до 100 участников.
Сама Meta не показала 20 и более одновременных участников в материалах к запуску. В основной демонстрации участвуют восемь говорящих, а в длинной записи размечены 11 участников. Число «более 20» — заявленная способность модели, а не количество людей в публичных демонстрациях.
Цена API
Muse Voice Transcribe стоит $3 за 1 000 минут, то есть $0,18 за час. Потоковая и непотоковая расшифровка тарифицируются одинаково. Meta также утверждает, что обработка с нулевым хранением данных стоит столько же, сколько стандартный режим.
Оплата начисляется только за фактически обработанное аудио и округляется вниз до целых секунд.
Сравнение опубликованных тарифов осложняется разными условиями у поставщиков:
Последнюю цифру нельзя напрямую считать самостоятельным почасовым тарифом API: она рассчитана из месячного пакета.
Muse не стала самым дешёвым сервисом потоковой расшифровки — Soniox сейчас публикует более низкую эквивалентную цену. Но $0,18 за час с уже включённой диаризацией выводят Meta в нижнюю часть рынка, особенно на фоне поставщиков, которые берут отдельную плату за определение говорящих.
При обработке 1 000 часов аудио по публичному тарифу Meta счёт составит примерно $180.
Точность распознавания
Низкая цена имеет смысл только при отсутствии серьёзной потери точности. В материалах Meta приводятся противоположные результаты.
В индексе потокового распознавания Artificial Analysis AA-WER Muse получила показатель ошибки в словах 3,1%. Далее идут:
Meta указывает, что по состоянию на 1 сентября Muse занимала первое место в потоковом бенчмарке Artificial Analysis — независимой сторонней компании, которая проводит оценку ИИ-систем.
Отдельно Meta приводит результат по диаризации. Средний показатель ошибки составил 17,5% на наборах AMI-IHM, AMI-SDM и VoxConverse — ниже, чем у конкурирующих систем, представленных на графике Meta.
Количество поддерживаемых говорящих и ошибка диаризации — разные показатели. Система, способная представить 100 участников, не обязательно точнее определяет, кому принадлежит конкретная реплика, чем система с лимитом в 20 человек. Кроме того, бенчмарк Meta не проверяет всех конкурентов на их заявленном максимальном количестве участников.
Ограничения
У Muse есть и ограничения, которые нужно учитывать при внедрении:
Вывод
Muse не установила мировой рекорд по числу говорящих, но это не единственный показатель для потоковой системы. Для корпоративных разработчиков важнее, сможет ли сервис одновременно сохранять правильную атрибуцию участников, точный текст и пригодные для работы границы реплик во время сложного разговора.
При цене $0,18 за час и диаризации более чем для 20 говорящих в той же модели Meta предлагает новый вариант для систем анализа встреч, расшифровки в реальном времени и инфраструктуры голосовых ИИ-агентов. При этом конкурентам придётся учитывать не только точность распознавания речи, но и качество определения говорящих вместе с общей стоимостью эксплуатации.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram