Первые собственные модели
Три модели охватывают коммерчески востребованные направления корпоративного ИИ:
По словам Сулеймана, MAI-Transcribe-1 стала первой выпущенной моделью команды и показывает лучшие в мире результаты в расшифровке речи. При этом для её работы требуется вдвое меньше графических процессоров, чем конкурирующим передовым системам.
Запуск состоялся в непростой для Microsoft момент. Акции компании завершили худший квартал со времён финансового кризиса 2008 года: инвесторы требуют доказательств, что сотни миллиардов долларов, вложенных в инфраструктуру ИИ, начнут приносить доход. Новые модели должны одновременно конкурировать на рынке и снижать себестоимость собственных продуктов Microsoft.
MAI-Transcribe-1 стала главным выпуском. На бенчмарке FLEURS — стандартном многоязычном тесте для распознавания речи — модель показала средний показатель ошибок в словах 3,8% на 25 языках, наиболее востребованных в продуктах Microsoft.
Согласно тестам Microsoft, MAI-Transcribe-1:
Модель построена на текстовом декодере на основе трансформера и двунаправленном аудиокодере. Она принимает файлы MP3, WAV и FLAC размером до 200 МБ. Скорость пакетной расшифровки, по данным Microsoft, в 2,5 раза выше, чем у действующего решения Microsoft Azure Fast.
Диаризация, учёт контекста и потоковая обработка пока обозначены как функции, которые появятся позже. Microsoft уже испытывает MAI-Transcribe-1 в голосовом режиме Copilot и в Microsoft Teams для расшифровки разговоров. Это показывает, что компания намерена быстро заменить сторонние и прежние внутренние модели собственными.
MAI-Voice-1 — модель Microsoft для преобразования текста в речь. Она способна создать 60 секунд естественно звучащего аудио за одну секунду и сохраняет голос говорящего в длинных материалах. Через Microsoft Foundry можно создавать индивидуальный голос всего по нескольким секундам исходной записи. Стоимость составляет $22 за 1 млн символов.
MAI-Image-2 при дебюте вошла в тройку лучших семейств моделей в таблице лидеров Arena.ai. В Microsoft Foundry и Copilot она генерирует изображения как минимум вдвое быстрее предыдущей версии. Модель внедряют в Bing и PowerPoint. Цена — $5 за 1 млн входных токенов текста и $33 за 1 млн токенов выходных изображений. Одним из первых корпоративных партнёров, использующих MAI-Image-2 в больших масштабах, стала рекламная группа WPP.
Что изменилось в соглашении с OpenAI
Понять значение запуска можно через договорные изменения, которые сделали собственную разработку Microsoft возможной. До октября 2025 года компания по условиям контракта не могла самостоятельно заниматься созданием общего искусственного интеллекта.
Первоначальное соглашение с OpenAI, подписанное в 2019 году, предоставляло Microsoft лицензию на модели OpenAI в обмен на строительство облачной инфраструктуры, необходимой этой компании. Однако OpenAI решила расширять вычислительные мощности за пределами Microsoft и заключила договоры с SoftBank и другими партнёрами. После этого стороны пересмотрели условия.
Как объяснял Сулейман в интервью Bloomberg в декабре 2025 года, ещё за несколько недель до того Microsoft не имела договорного права самостоятельно заниматься общим ИИ или сверхинтеллектом. Новые условия разрешили компании создавать собственные передовые модели, сохранив за ней права на лицензирование всего, что разработает OpenAI, до 2032 года.
Сулейман рассказал VentureBeat, что в сентябре прошлого года Microsoft пересмотрела договор с OpenAI, после чего начала самостоятельно развивать направление сверхинтеллекта, собирать вычислительные мощности, формировать команду и закупать необходимые данные.
При этом партнёрство с OpenAI продолжается. По словам Сулеймана, Microsoft будет сотрудничать с компанией как минимум до 2032 года и, возможно, дольше. Он назвал OpenAI выдающимся партнёром. Через API Microsoft Foundry компания также предоставляет доступ к Claude от Anthropic, представляя себя как «платформу платформ».
Одновременно Microsoft создаёт возможности для самостоятельной работы. В марте, как ранее сообщал Business Insider, Сулейман написал во внутренней записке, что намерен сосредоточиться на развитии сверхинтеллекта и в течение следующих пяти лет поставлять Microsoft модели мирового уровня.
CNBC сообщала, что после структурных изменений Сулейман отошёл от повседневного управления продуктами Copilot. Обязанности исполнительного вице-президента объединённого направления потребительского и коммерческого Copilot перешли к бывшему руководителю Snap Джейкобу Андреу.
Небольшие команды и низкие затраты
Команды, создавшие новые модели, оказались небольшими. По словам Сулеймана, аудиомодель разрабатывали 10 человек, а основная часть прироста скорости, эффективности и точности стала результатом архитектуры модели и использованных данных. В команде изображений также работает меньше 10 человек.
Сулейман придерживается плоской структуры, в которой небольшое число сотрудников получает больше самостоятельности. По его словам, результат обеспечили инновации в архитектуре моделей и работе с данными.
Такой подход бросает вызов распространённому представлению о том, что для разработки передовых моделей нужны тысячи исследователей и миллиардные расходы на персонал. Meta, напротив, по описанию Сулеймана в интервью Bloomberg, делала ставку на привлечение большого числа отдельных специалистов, а не на создание единой команды. Для ведущих исследователей, как сообщалось, компания предлагала компенсационные пакеты от $100 млн до $200 млн.
Небольшие команды, создающие модели передового уровня, меняют и экономику разработки. Если Microsoft действительно может получить передовую систему расшифровки речи с помощью 10 инженеров и половины вычислительных ресурсов конкурентов, её экономические модели ИИ будут требовать другой структуры расходов по сравнению с компаниями, которые тратят большие суммы ради сопоставимых результатов.
Как работает команда Сулеймана
Философия небольших команд отражается и на повседневной работе подразделения. Описывая его устройство, Сулейман сравнил рабочую среду скорее с торговым залом молодой компании, чем с обычным инженерным отделом Microsoft.
Сотрудники сидят группами за круглыми столами, работают на ноутбуках, а не за традиционными большими экранами. Они вместе занимаются созданием программ — совместным написанием кода — с утра до вечера, в помещениях по 50–60 человек.
Гуманистический ИИ
Сулейман постепенно формирует отдельную философию ИИ Microsoft, которую называет «гуманистическим ИИ». Этот термин появился в его публикации по случаю запуска новых моделей и звучал в интервью VentureBeat.
По его словам, гуманистический сверхинтеллект должен служить человечеству. Люди должны оставаться главной управляющей силой и сохранять контроль, а сама система — действовать в соответствии с человеческими интересами.
Такая формулировка решает сразу несколько задач. Она отделяет Microsoft от более ориентированной на ускорение риторики OpenAI и Meta. Кроме того, она обращена к корпоративным заказчикам, которым перед внедрением ИИ в регулируемых отраслях нужны гарантии управления, соответствия требованиям и безопасности.
В декабрьском интервью Bloomberg Сулейман назвал сдерживание и согласование поведения с интересами людей «красными линиями». По его мнению, инструменты сверхинтеллекта нельзя выпускать до тех пор, пока разработчики не будут уверены, что способны их контролировать.
Происхождение данных
Сулейман также назвал конкурентным преимуществом происхождение обучающих данных. Он рассказал о разговоре с генеральным директором Microsoft Сатьей Наделлой, в котором обсуждалась необходимость создавать «чистую линию происхождения моделей» с качественными данными.
Здесь Microsoft противопоставляет свой подход открытым моделям. Сулейман отметил, что многие открытые модели обучались на данных, полученных неподобающим образом, и это может создавать проблемы с безопасностью.
Для корпоративных клиентов, выбирающих поставщика ИИ на фоне многочисленных исков о нарушении авторских прав, происхождение данных становится коммерческим аргументом. Если Microsoft сможет подтвердить, что получила обучающие материалы по корректно лицензированным каналам, заказчики столкнутся с меньшими юридическими и репутационными рисками при использовании моделей в рабочих системах.
Сразу три направления конкуренции
Новые модели выводят Microsoft сразу на три конкурентных направления.
MAI-Transcribe-1 напрямую соперничает с моделями Whisper от OpenAI, которые доминировали в открытом сообществе распознавания речи. Microsoft заявляет о превосходстве над ними по точности на всех 25 языках тестирования.
Результаты FLEURS также показывают преимущество перед Gemini 3.1 Flash Lite от Google на 22 языках из 25. Это становится прямым вызовом Google, активно распространяющей Gemini в собственной линейке продуктов.
MAI-Voice-1 конкурирует с ElevenLabs, Resemble ИИ и другими молодыми компаниями в сфере голосового ИИ. Возможность клонировать голос по нескольким секундам аудио и создавать речь со скоростью, в 60 раз превышающей реальное время, усиливает позиции Microsoft. Разработчики Foundry получают доступ к этим функциям через тот же API, который используется для GPT-4 и Claude. Дополнительным преимуществом становится распространение через продукты Microsoft.
Сулейман заявил, что теперь считает Microsoft лабораторией из тройки лидеров сразу после OpenAI и Gemini. Цены на модели отражают сознательную ставку на стоимость:
Сулейман отметил, что Microsoft намеренно выставила цены ниже, чем любой другой крупный облачный провайдер, включая Amazon и Google.
Расходы Microsoft на ИИ
Для Microsoft такая стратегия позволяет распределять затраты на разработку моделей среди огромной базы корпоративных клиентов. Одновременно она отвечает на вопрос инвесторов о том, когда расходы на ИИ начнут приносить отдачу.
По данным CNBC, с начала года акции Microsoft подешевели примерно на 17% на фоне более широкого падения котировок компаний-разработчиков программного обеспечения.
Модели, которым требуется вдвое меньше графических процессоров, снижают инфраструктурные расходы Microsoft на собственные продукты — Teams, Copilot, Bing и PowerPoint. При этом разработчикам предлагают цены, рассчитанные на конкуренцию со всем рынком.
В мартовской записке Сулейман писал, что его модели должны обеспечить снижение себестоимости, необходимое для обслуживания ИИ-нагрузок в огромных масштабах в ближайшие годы. Три представленные системы стали первым практическим результатом этого обещания.
Следующий шаг — большая языковая модель
Сулейман дал понять, что расшифровка речи, генерация голоса и изображений — только начало. На вопрос о разработке большой языковой модели, которая напрямую конкурировала бы с GPT на передовом уровне, он ответил, что Microsoft намерена создавать модели мирового уровня во всех модальностях.
Цель компании — в случае необходимости самостоятельно предоставить модели передового уровня, с высокой эффективностью и минимальной стоимостью.
Сулейман описал многолетний план, включающий создание кластеров графических процессоров нужного масштаба. Команду сверхинтеллекта официально сформировали только в октябре 2025 года. В интервью Сулейман говорил из Майами, где вся команда собралась на одну из регулярных очных недель.
По его словам, Сатья Наделла также приехал на встречу, чтобы представить план того, чего Microsoft должна достичь в рамках миссии по самодостаточности ИИ в следующие 2, 3 и 4 года, включая необходимое расширение вычислительных ресурсов.
Разработка конкурентной передовой большой языковой модели будет намного сложнее нынешних задач — по объёму данных, вычислительной мощности и общей сложности. Представленные модели специализированы: они работают с аудио и изображениями, но не решают задачи общего рассуждения и генерации текста, лежащие в основе ChatGPT и ключевого интеллекта Copilot.
У Сулеймана есть организационные полномочия, публичная поддержка Наделлы и свобода, которую дало новое соглашение с OpenAI. Однако подтверждённого опыта создания самых сложных ИИ-систем внутри Microsoft у него пока нет.
Нынешний запуск показывает, что три модели уже достигли передового или близкого к нему уровня в своих областях. Их создали команды, меньшие большинства молодых компаний на ранней стадии, они работают на половине стандартного для отрасли объёма графических процессоров и стоят дешевле решений крупных облачных конкурентов.
Два года назад Сулейман предложил в MIT Technology Review «современный тест Тьюринга»: проверять ИИ не по тому, способен ли он обмануть человека в разговоре, а по тому, может ли система выполнять реальные экономические задачи с минимальным контролем. Представленные в четверг модели стали шагом в этом направлении. Теперь Microsoft предстоит показать, сможет ли команда повторить результат в масштабе, который имеет значение для бизнеса, пока терпение рынка не подошло к концу.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram