i
ДАТАИСТ
Новости · 2026-09-06

Новая аудиомодель Meta в реальном времени — основа ИИ-помощников, которые не перестают слушать

@neuronium_ai @neuronium_ai

Meta выпустила Muse Voice Transcribe — модель для распознавания речи в реальном времени. Она расшифровывает разговор, определяет границы предложений и различает до 20 говорящих без отдельных систем. Модель обрабатывает звук фрагментами по 80 миллисекунд и сама выбирает задержку для каждого слова. Она поддерживает более 70 языков, уже работает в Meta ИИ и доступна через Meta Model API. Стоимость составляет $0,18 в час — ниже, чем у OpenAI и ElevenLabs.

Обложка: Новая аудиомодель Meta в реальном времени — основа ИИ-помощников, которые не перестают слушать

Что умеет Muse Voice Transcribe

Подразделение Meta Superintelligence Labs выпустило свою первую модель восприятия аудио в реальном времени. Она расшифровывает речь, различает говорящих и определяет границы предложений во время живого разговора.

Модель семейства Spark делит входящий звук на фрагменты по 80 миллисекунд. После каждого фрагмента она решает, продолжить ли прослушивание или вывести следующее слово в текст. Так модель определяет, сколько контекста собрать перед фиксацией расшифровки.

Чем дольше ожидание, тем выше точность, но тем больше задержка. По данным Meta, Muse Voice Transcribe меняет время ожидания для каждого слова в зависимости от его сложности: простые слова появляются быстрее, а сложные получают больше времени на обработку. Meta обучала это поведение с помощью обучения с подкреплением, одновременно поощряя низкую долю ошибок и короткую задержку.

Адаптивная задержка смещает компромисс между скоростью и точностью, поскольку модель решает для каждого слова, как долго продолжать слушать

Адаптивная задержка смещает компромисс между скоростью и точностью, поскольку модель решает для каждого слова, как долго продолжать слушать

Источник: the-decoder.com

Разделение говорящих и границы предложений

Остальные функции Meta встроила в ту же модель, отказавшись от отдельных систем. При смене говорящего модель отмечает это в текущем тексте и присваивает каждому фрагменту идентификатор от A до Z. Границы предложений она обозначает там, где начинается и заканчивается каждая реплика. Оба навыка обучались одновременно с распознаванием речи.

Модель способна одновременно различать более 20 говорящих и обрабатывать записи длительностью свыше часа без последующей обработки. В демонстрации с восемью людьми в одной комнате система в реальном времени распределяла слова между отдельными участниками, сообщает Meta.

Meta утверждает, что обучила Muse Voice Transcribe более чем на 70 языках, а 25 из них проверила подробно. Модель также обрабатывает переключение языков, когда говорящий переходит с одного языка на другой в середине предложения. Подсказки о языке, ключевых словах и контексте могут дополнительно повысить точность, особенно при распознавании имён собственных вроде «Meta», «Muse» или «Menlo Park».

В тестировании Artificial Analysis от 1 сентября 2026 года Muse Voice Transcribe выдаёт наиболее точную окончательную расшифровку после обнаружения окончания речи

В тестировании Artificial Analysis от 1 сентября 2026 года Muse Voice Transcribe выдаёт наиболее точную окончательную расшифровку после обнаружения окончания речи

Источник: the-decoder.com

Сравнение с другими моделями

Artificial Analysis подтвердил заявления Meta в независимой проверке. На английском языке Muse Voice Transcribe показала долю ошибок в словах 3,1% и задержку 0,16 секунды после окончания реплики. Результаты других систем:

ElevenLabs Scribe v2 Realtime — 3,6% ошибок и 0,14 секунды задержки.
AssemblyAI Universal-3.5 Pro Realtime — 4,0% ошибок.
Cartesia Ink-2 — 3,4% или 4,0% ошибок в зависимости от того, определяет ли модель конец реплики самостоятельно или использует внешнюю систему.

Конкуренция в этой области остаётся высокой. В мае OpenAI выпустила GPT-Realtime-Whisper для той же задачи, а в июле снизила цены на модели транскрибации.

Meta связывает выпуск модели с видением генерального директора Марка Цукерберга, который говорит о «персональном сверхинтеллекте». В постановочной демонстрации сотрудники Meta заявили, что надёжное распознавание речи станет основой для персональных ИИ-агентов, способных слушать реальные разговоры через очки с ИИ. В Германии недавно обсуждали запрет на очки Meta с камерами, однако Федеральное сетевое агентство Германии решило не продолжать разбирательство.

Доступность

Muse Voice Transcribe уже используется для голосового ввода в Meta ИИ и Muse Code, а также доступна через Meta Model API. Попробовать её можно, удерживая клавишу Fn в любом приложении.

Meta установила цену ниже, чем у конкурентов:

$0,18час работы
$31 000 минут аудио
$4Cartesia Ink-2
$6,50ElevenLabs Scribe v2 Realtime и Deepgram Flux
Meta Muse Voice Transcribe — $0,18 в час, или $3 за 1 000 минут аудио.
Cartesia Ink-2 — $4 за 1 000 минут.
ElevenLabs Scribe v2 Realtime и Deepgram Flux — по $6,50 за 1 000 минут.

Это продолжение стратегии, которую Meta применяла с Muse Spark 1.1 и Muse Spark 1.2: компания конкурирует ценой, а не максимальными показателями качества. Meta не раскрыла количество параметров модели, объём обучающих данных и источники аудиоданных, а её веса выпускать не стала.

Летом 2025 года Meta реорганизовала ИИ-подразделение и объединила его под брендом Superintelligence Labs. Компания наняла ведущих исследователей из OpenAI, Google DeepMind и Apple, предлагая им пакеты вознаграждений до $300 млн на четыре года. Однако остались не все: некоторые специалисты вернулись в OpenAI всего через несколько недель.

Источник: the-decoder.com

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram