Что умеет Muse Voice Transcribe
Подразделение Meta Superintelligence Labs выпустило свою первую модель восприятия аудио в реальном времени. Она расшифровывает речь, различает говорящих и определяет границы предложений во время живого разговора.
Модель семейства Spark делит входящий звук на фрагменты по 80 миллисекунд. После каждого фрагмента она решает, продолжить ли прослушивание или вывести следующее слово в текст. Так модель определяет, сколько контекста собрать перед фиксацией расшифровки.
Чем дольше ожидание, тем выше точность, но тем больше задержка. По данным Meta, Muse Voice Transcribe меняет время ожидания для каждого слова в зависимости от его сложности: простые слова появляются быстрее, а сложные получают больше времени на обработку. Meta обучала это поведение с помощью обучения с подкреплением, одновременно поощряя низкую долю ошибок и короткую задержку.
Адаптивная задержка смещает компромисс между скоростью и точностью, поскольку модель решает для каждого слова, как долго продолжать слушать
Источник: the-decoder.com
Разделение говорящих и границы предложений
Остальные функции Meta встроила в ту же модель, отказавшись от отдельных систем. При смене говорящего модель отмечает это в текущем тексте и присваивает каждому фрагменту идентификатор от A до Z. Границы предложений она обозначает там, где начинается и заканчивается каждая реплика. Оба навыка обучались одновременно с распознаванием речи.
Модель способна одновременно различать более 20 говорящих и обрабатывать записи длительностью свыше часа без последующей обработки. В демонстрации с восемью людьми в одной комнате система в реальном времени распределяла слова между отдельными участниками, сообщает Meta.
Meta утверждает, что обучила Muse Voice Transcribe более чем на 70 языках, а 25 из них проверила подробно. Модель также обрабатывает переключение языков, когда говорящий переходит с одного языка на другой в середине предложения. Подсказки о языке, ключевых словах и контексте могут дополнительно повысить точность, особенно при распознавании имён собственных вроде «Meta», «Muse» или «Menlo Park».
В тестировании Artificial Analysis от 1 сентября 2026 года Muse Voice Transcribe выдаёт наиболее точную окончательную расшифровку после обнаружения окончания речи
Источник: the-decoder.com
Сравнение с другими моделями
Artificial Analysis подтвердил заявления Meta в независимой проверке. На английском языке Muse Voice Transcribe показала долю ошибок в словах 3,1% и задержку 0,16 секунды после окончания реплики. Результаты других систем:
Конкуренция в этой области остаётся высокой. В мае OpenAI выпустила GPT-Realtime-Whisper для той же задачи, а в июле снизила цены на модели транскрибации.
Meta связывает выпуск модели с видением генерального директора Марка Цукерберга, который говорит о «персональном сверхинтеллекте». В постановочной демонстрации сотрудники Meta заявили, что надёжное распознавание речи станет основой для персональных ИИ-агентов, способных слушать реальные разговоры через очки с ИИ. В Германии недавно обсуждали запрет на очки Meta с камерами, однако Федеральное сетевое агентство Германии решило не продолжать разбирательство.
Доступность
Muse Voice Transcribe уже используется для голосового ввода в Meta ИИ и Muse Code, а также доступна через Meta Model API. Попробовать её можно, удерживая клавишу Fn в любом приложении.
Meta установила цену ниже, чем у конкурентов:
Это продолжение стратегии, которую Meta применяла с Muse Spark 1.1 и Muse Spark 1.2: компания конкурирует ценой, а не максимальными показателями качества. Meta не раскрыла количество параметров модели, объём обучающих данных и источники аудиоданных, а её веса выпускать не стала.
Летом 2025 года Meta реорганизовала ИИ-подразделение и объединила его под брендом Superintelligence Labs. Компания наняла ведущих исследователей из OpenAI, Google DeepMind и Apple, предлагая им пакеты вознаграждений до $300 млн на четыре года. Однако остались не все: некоторые специалисты вернулись в OpenAI всего через несколько недель.
Источник: the-decoder.com
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram