i
ДАТАИСТ
Новости · 2026-09-05

MAI-Transcribe-2 от Microsoft обходит OpenAI, Google и ElevenLabs по цене и скорости

@neuronium_ai @neuronium_ai

Microsoft ИИ выпустила MAI-Transcribe-2 — модель распознавания речи, которая, по заявлению компании, превосходит по скорости и точности решения OpenAI, Google и ElevenLabs и стоит дешевле. Цена запуска — 10 центов за час аудио против 36 центов у первой модели линейки, выпущенной пять месяцев назад. Для компании, обрабатывающей 100 000 часов записей колл-центра в год, расходы снизятся с $36 000 до $10 000. Одновременно Microsoft расширила поддержку до 60 языков и добавила расшифровку с разделением говорящих, временными метками и переключением между языками.

Обложка: MAI-Transcribe-2 от Microsoft обходит OpenAI, Google и ElevenLabs по цене и скорости

Что умеет MAI-Transcribe-2

Модель работает с аудио на 60 языках. У MAI-Transcribe-1.5, выпущенной в июне, их было 43, а у первой версии, представленной в апреле, — 25.

MAI-Transcribe-2 доступна через Microsoft Foundry — площадку Microsoft с моделями для разработчиков, — и MAI Playground, среду для тестирования. Microsoft заявляет, что обучала модель на реальных деловых записях: с фоновым шумом, плохим качеством звука и одновременной речью нескольких людей, а не только на чистых студийных записях.

В базовую версию вошли функции, которые превращают расшифровку из сплошного текста в рабочий документ:

разделение говорящих определяет, кто именно произносил каждую реплику;
временные метки на уровне слов позволяют искать, редактировать текст и синхронизировать его с видео;
настройка ключевых слов помогает правильно распознавать названия лекарств, коды продуктов и имена сотрудников;
автоматическое определение языка избавляет пользователя от необходимости заранее указывать язык записи.

Отдельно Microsoft выделяет две функции. Настраиваемый стиль вывода позволяет выбрать дословный режим, сохраняющий все «э-э», оговорки и запинки для юридических и служб внутреннего контроля, либо чистый режим, убирающий слова-паразиты для заметок и субтитров.

Переключение языков рассчитано на разговоры, где собеседники меняют язык прямо посреди фразы. Microsoft прямо упоминает хинглиш и спанглиш — смешение английского с хинди и испанским соответственно. Раньше специализированные поставщики часто брали за такие возможности отдельную плату. Microsoft включила их в тариф за 10 центов.

Что показывают бенчмарки

Microsoft приводит три заявления о производительности, каждое основано на отдельном способе измерения.

Первое: MAI-Transcribe-2 заняла первое место в FLEURS по 60 языкам со средней долей ошибок в словах 5,2%. FLEURS — бенчмарк, опубликованный исследователями Google в 2022 году. В нём носители языка читают около 2 000 предложений на каждом из 102 языков — примерно 12 часов речи на язык.

Этот набор часто используют для сравнения многоязычных систем: на одинаковом материале можно сопоставить распознавание, например, суахили и шведского. Показатель ошибок учитывает замены, вставки и пропуски относительно человеческой расшифровки. Результат 5,2% означает, что ошибочным оказывается примерно каждое двадцатое слово.

У показателя есть ограничение: FLEURS проверяет чтение подготовленного текста, а не обычный разговор. Кроме того, средний результат MAI-Transcribe-2 оказался выше, чем 3,7% у MAI-Transcribe-1.5 в июне. Вероятнее всего, это связано с расширением охвата: среднее теперь считают по 60 языкам вместо 43, включая языки с небольшим количеством данных, на которых ошибаются все модели. Покупателям всё равно стоит запросить результаты отдельно по каждому языку.

Второе заявление: модель занимает второе место в рейтинге Artificial Analysis по доле ошибок в словах и формирует парето-границу точности и задержки. Artificial Analysis — независимый оценщик, который проверяет модели через их открытые API и измеряет результат, доступный реальному клиенту.

В его индексе есть имитации диалогов с ИИ-агентами, выступления в Европейском парламенте и звонки с обсуждением финансовых результатов компаний. Большой вес имеют деловые разговоры на английском языке.

В июне Artificial Analysis поставила MAI-Transcribe-1.5 на третье место с результатом 2,4% ошибок в словах. Её опередили Fun-Realtime-ASR-preview от Alibaba и Scribe v2 от ElevenLabs, при этом Microsoft стала самой быстрой моделью в первой десятке. Второе место новой версии означает, что она, вероятно, обошла ElevenLabs.

Парето-граница означает, что ни один конкурент не превосходит MAI-Transcribe-2 по точности, не жертвуя скоростью, и не работает быстрее без потери точности.

Третье заявление касается скорости. По оценкам Artificial Analysis, модель работает:

в 10 раз быстрее GPT-Transcribe от OpenAI;
в 7 раз быстрее Scribe v2 от ElevenLabs;
в 5 раз быстрее Gemini 3.5 Transcribe от Google.

При пакетной расшифровке скорость важна прежде всего как показатель пропускной способности и стоимости. Модель, работающая со скоростью 300-кратного реального времени, требует лишь часть GPU-часов по сравнению с моделью, работающей в 30-кратном режиме. Именно такая эффективность, по логике Microsoft, позволяет установить цену в 10 центов и при этом сохранять прибыльность.

Пять месяцев разработки

Первая версия MAI-Transcribe-1 вышла 2 апреля с поддержкой 25 языков и ценой $0,36 за час. 2 июня появилась MAI-Transcribe-1.5: 43 языка, настройка ключевых слов и третье место в рейтинге Artificial Analysis. Теперь MAI-Transcribe-2 предлагает 60 языков, разделение говорящих, временные метки, переключение языков, второе место в рейтинге и цену $0,10.

1MAI-Transcribe-1
2MAI-Transcribe-1.5
3MAI-Transcribe-2

За пять месяцев Microsoft выпустила три версии. На каждом этапе число языков росло примерно на 40%, а к продукту добавлялись функции, которые конкуренты нередко прячут за более дорогими тарифами.

Такой темп, пишет источник, характерен для команды, которая уже закрепила архитектуру и теперь последовательно наращивает данные и масштаб. Для моделей распознавания речи это этап, когда улучшения могут происходить быстро и предсказуемо. Одновременно Microsoft стремится превратить расшифровку в массовую услугу раньше конкурентов.

Как устроена команда Microsoft ИИ

В апреле Мустафа Сулейман, руководитель Microsoft ИИ, рассказал The Verge, что первую модель создала небольшая команда из 10 человек. По его словам, её освободили от бюрократии, а более крупная группа занималась поставщиками и сбором данных.

Сулейман также говорил The Verge, что модель использовала вдвое меньше GPU-ресурсов, чем другие передовые модели. Он назвал это значительной экономией для Microsoft. Как отмечало издание, похожие упрощённые структуры пробовали Meta, Amazon, Google и Anthropic.

Линейка моделей для распознавания речи стала самым заметным испытанием того, способна ли такая организация давать коммерческий результат, а не только исследовательские публикации.

Зачем Microsoft собственные модели

Microsoft вложила в OpenAI более $13 млрд и размещает модели компании в Azure, Office и Copilot. Поэтому на протяжении последних четырёх лет напрашивался вопрос: зачем Microsoft создавать собственные модели?

Ответ связан с независимостью.

Когда в марте 2024 года Microsoft наняла Мустафу Сулеймана из Inflection ИИ вместе с большей частью сотрудников этой компании, генеральный директор Salesforce Марк Бениофф воспринял это как заявление о намерениях. В январе 2025 года он сказал CNBC, что Microsoft создаёт собственный ИИ и в будущем, вероятно, не будет использовать OpenAI, потому что хочет иметь собственные передовые модели. По мнению Бениоффа, именно поэтому компания наняла Сулеймана.

У Бениоффа были собственные мотивы: Salesforce конкурирует с Microsoft и инвестирует в Anthropic. Но последующие события в целом подтвердили его предположение.

В октябре 2025 года Microsoft и OpenAI пересмотрели партнёрство. Согласно объявлению Microsoft, компания впервые получила возможность самостоятельно заниматься созданием общего искусственного интеллекта или делать это вместе с другими партнёрами.

Сулейман рассказал The Verge, что пересмотр соглашения открыл Microsoft путь к разработке сверхинтеллекта. Через несколько недель Microsoft объявила о создании команды MAI Superintelligence.

В апреле 2026 года компании снова изменили договорённости. По сообщениям того времени, Microsoft лишилась эксклюзивного доступа к моделям OpenAI, а выплаты OpenAI в виде доли выручки были отменены. Каждое изменение ослабляло связь между компаниями, и после каждого из них появлялись новые модели MAI.

Вторая причина — прибыльность. Каждый запрос, который Microsoft отправляет в модель OpenAI, обходится ей в деньги. Запрос к собственной модели на собственных GPU стоит дешевле.

В июле Bloomberg сообщил, что Microsoft начала использовать модели MAI для части запросов пользователей в Word и Excel. Ранее компания рекламировала эти продукты как работающие на OpenAI и Anthropic. TechCrunch связало этот переход с общим сокращением расходов на ИИ: по данным издания, расходы также урезали Amazon, Uber, Meta и Accenture.

Почему первой стала расшифровка

Распознавание речи удобно для замены сторонних моделей: задача ограничена, а качество можно измерить объективными показателями.

Microsoft владеет Teams, который создаёт огромный объём записей совещаний. Ей также принадлежит Nuance, чьи решения для медицинской документации работают на распознавании речи. Кроме того, Microsoft управляет речевыми сервисами Azure, которыми уже пользуются тысячи компаний.

Каждая из этих нагрузок может перейти на MAI-Transcribe-2. Каждый перенесённый час означает, что Microsoft больше не платит за него другому поставщику.

Сулейман довольно прямо описал эту цель в разговоре с The Verge в апреле. По его словам, разговор о сверхинтеллекте на практике сводится к тому, способны ли модели приносить пользу миллионам компаний, которые рассчитывают на Microsoft в вопросах передовых языковых моделей.

Как бы ни использовать термин «сверхинтеллект» применительно к API для расшифровки речи, коммерческая логика понятна: один раз создать технологию, внедрить её в несколько продуктов и перестать платить партнёру, который постепенно становится конкурентом.

С кем конкурирует MAI-Transcribe-2

В сообщении Microsoft называет четыре конкурирующих продукта:

GPT-Transcribe от OpenAI;
Gemini 3.5 Transcribe от Google;
Whisper V3-Large от OpenAI;
Scribe v2 от ElevenLabs.

При этом Microsoft не упоминает Deepgram, AssemblyAI, Speechmatics и Rev — компании, которые уже десять лет продают корпоративные услуги расшифровки. Компания позиционирует продукт прежде всего против передовых лабораторий, а не против устоявшихся специализированных поставщиков.

В этом сравнении есть и реклама, и реальные основания. Передовые лаборатории воспринимали распознавание речи как одну из функций более широких платформ и назначали соответствующую цену. Специализированная модель, которая работает в 5–10 раз быстрее при сопоставимой точности, действительно отличается от таких решений.

Но сильнее всего ценовое давление почувствуют профильные поставщики. При цене $0,10 за час Microsoft выходит на уровень или ниже многих корпоративных контрактов с большим объёмом данных, одновременно включая в базовый тариф разделение говорящих, временные метки и 60 языков.

Их главным преимуществом остаётся глубина в отдельных областях: медицинская лексика, юридическое форматирование и отраслевые интеграции. Функция настройки ключевых слов в Microsoft прямо направлена на эту область.

Единственный конкурент, которого Microsoft не заявляет как побеждённого по точности, — Alibaba. На протяжении большей части 2026 года модели компании занимали ведущие места в независимых рейтингах.

В июле TechCrunch сообщил, что некоторые американские компании начали оценивать китайские модели как более дешёвую альтернативу, несмотря на опасения по поводу безопасности. Для таких клиентов предложение Microsoft звучит достаточно ясно: сопоставимая точность, более быстрый инференс, меньшая цена и поставщик, которому уже доверяют их службы внутреннего контроля.

Что ещё предстоит проверить

Несмотря на подробности о бенчмарках, сообщение оставляет несколько практических вопросов.

Первый — срок действия цены. Microsoft называет $0,10 за час предложением на старте, но не указывает дату его окончания и стандартную стоимость после запуска. Компаниям, которые рассчитывают бюджет, стоит получить оба значения в письменном виде.

Второй вопрос — потоковая обработка. В сообщении акцент сделан на пакетной обработке и длинных аудиозаписях, но ничего не сказано о распознавании в реальном времени, которое требуется голосовым ИИ-агентам и живым субтитрам. У Artificial Analysis есть отдельный рейтинг потоковых моделей, поэтому молчание Microsoft на эту тему заметно.

Третий вопрос — точность по отдельным языкам. Среднее значение 5,2% для 60 языков может означать 3% ошибок на распространённых языках и 12% на языках с небольшим объёмом данных. Поэтому компаниям с конкретными языковыми требованиями нужно самостоятельно проверять нужные языки.

Четвёртый — качество разделения говорящих. Доля ошибок в словах не измеряет, правильно ли назначена реплика конкретному человеку. Текст может иметь почти идеальный показатель и при этом приписывать каждое второе предложение не тому участнику разговора. Microsoft не приводит показатель ошибок разделения говорящих или сопоставимую метрику.

Пятый — обращение с данными. Корпоративные записи могут содержать медицинские сведения, юридически защищённую информацию и финансовые данные. В сообщении ничего не сказано о размещении данных, сроках хранения и о том, используется ли загруженное в Foundry аудио для дальнейшего обучения.

В апрельских материалах Microsoft описывала обучающие данные как сочетание записей, отобранных людьми, шумных аудиозаписей, сделанных подрядчиками, и «огромных объёмов данных из открытого интернета», писал The Verge. Для регулируемых отраслей это повод задать поставщику подробные вопросы. Для запуска такие пробелы необычными не выглядят, но именно они отделяют победу в рейтинге от внедрения в рабочую систему.

Единая стратегия Microsoft ИИ

Если выйти за пределы распознавания речи, становится заметна более широкая схема. Подразделение Microsoft ИИ теперь выпускает модели для изображений, голоса, расшифровки, кода, рассуждения и кибербезопасности. На конференции Build в июне компания представила семь новых моделей MAI в рамках одного выступления.

Все они следуют одному плану:

выбрать чётко очерченную область;
агрессивно оптимизировать стоимость инференса;
установить цену ниже, чем у передовых лабораторий;
распространять модели через Foundry;
постепенно внедрять их в собственные продукты Microsoft.

Microsoft не пытается создать одну модель, которая превосходит GPT или Gemini во всём. Компания формирует набор специализированных моделей, которые вместе позволят обслуживать большую часть корпоративных задач без оплаты сторонним поставщикам, а свободные мощности продавать остальным клиентам по цене, с которой профильным компаниям будет трудно конкурировать.

Расшифровка речи стала первой областью, где такой подход полностью созрел. Поэтому примечания к MAI-Transcribe-2 выглядят скорее шаблоном для будущих продуктов, чем обычным описанием одной модели.

Мустафа Сулейман два года говорил о «гуманистическом сверхинтеллекте» и ИИ-помощниках, которые отвечают интересам пользователей и действуют на их стороне. Практическая реализация выглядит гораздо проще: пять месяцев назад Microsoft брала 36 центов за превращение часа речи в текст, а теперь снизила цену до 10 центов, добавила шесть функций, которые конкуренты продают отдельно, и заявила о первом месте в стандартном многоязычном бенчмарке.

MAI-Transcribe-2 уже доступна через Microsoft Foundry и MAI Playground.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram