i
Новости
Новости · 2026-09-22

«Лучше DeepSeek»: Xiaomi вывела MiMo-V2.6-Pro в лидеры открытых моделей и выпустила дешёвую V2.6-Flash

@neuronium_ai @neuronium_ai

Xiaomi представила MiMo-V2.6-Pro — модель с открытыми весами, которая набрала 46 баллов в индексе интеллекта Artificial Analysis и вышла на первое место среди открытых моделей. Она сравнялась с Grok 4.7, опередила Grok 4.6, Gemini 3.8 Flash и модели DeepSeek V4.1, а доступ через API Xiaomi стоит от $0.435 за миллион входных токенов и $0.87 за миллион выходных. Одновременно компания выпустила более дешёвую MiMo-V2.6-Flash с ценой $0.14/$0.28 за миллион токенов, а также версию Pro-UltraSpeed, которая генерирует ответы в 20 раз быстрее обычной Pro. Все модели рассчитаны на контекст до 1 млн токенов и мультимодальный ввод.

Обложка: «Лучше DeepSeek»: Xiaomi вывела MiMo-V2.6-Pro в лидеры открытых моделей и выпустила дешёвую V2.6-Flash

Результат оказался неожиданным: Xiaomi за пределами Китая известна прежде всего смартфонами, электромобилями и бытовой электроникой, а не передовыми моделями.

MiMo-V2.6-Pro при этом распространяется под лицензией MIT и заметно дешевле многих закрытых моделей сопоставимого уровня. Разработчики и компании могут бесплатно скачать её с Hugging Face, адаптировать или выполнить файн-тюнинг под свои задачи, запустить на собственном или арендованном оборудовании и использовать в рабочих системах — без платежей Xiaomi.

Модель также доступна через API Xiaomi. Для компаний с ограничениями на использование серверов в Китае этот вариант может быть сложнее, зато цены относятся к самым низким среди моделей такого класса:

$0.435 за миллион входных токенов без кэширования;
$0.87 за миллион выходных токенов;
$0.13 за одну задачу в индексе интеллекта Artificial Analysis;
около 134 токенов в секунду;
контекстное окно на 1 млн токенов;
ввод текста, изображений, аудио и видео.

Вместе с флагманом вышла MiMo-V2.6-Flash — меньшая и значительно более дешёвая модель для рабочих нагрузок с большим числом запросов. Она сохраняет контекст на 1 млн токенов и встроенную мультимодальность, а её API стоит $0.14 за миллион входных и $0.28 за миллион выходных токенов. По оценке авторов, это вторая по дешевизне крупная передовая модель в мире среди доступных через API.

Xiaomi также выпускает MiMo-V2.6-Pro-UltraSpeed. Компания утверждает, что эта версия способна генерировать ответы со скоростью до 20 раз выше обычной Pro.

В совокупности V2.6 выглядит не отдельным выпуском модели, а очередным этапом создания Xiaomi полного открытого стека для ИИ-агентов: от базовых моделей и агентов для программирования до оболочек, сред для обучения с подкреплением и инфраструктуры обучения.

От смартфонов к передовым моделям

Переход Xiaomi к передовым моделям ускорился за последний год.

Компания начала публично расширять семейство MiMo в 2025 году, а в течение большей части 2026-го углубляла работу с ИИ-агентами. Выпуск MiMo-V2.5 и V2.5-Pro в апреле заложил многие архитектурные и экономические принципы, которые теперь используются в V2.6:

разреженные модели со смесью экспертов;
контекстные окна на 1 млн токенов;
разрешительная лицензия;
низкая стоимость длительных задач ИИ-агентов.

MiMo-V2.5-Pro уже была моделью со смесью экспертов на 1,02 трлн параметров, из которых во время инференса использовались 42 млрд. Её специально обучали длительным задачам по разработке программного обеспечения и тому, что Xiaomi называла «осведомлённостью об оболочке»: способностью управлять памятью и контекстом внутри инфраструктуры ИИ-агента на протяжении сотен и тысяч вызовов инструментов.

В июне Xiaomi выпустила MiMo Code — открытого агента для программирования в терминале с постоянной памятью между сессиями, контрольными точками задач и отдельным вспомогательным агентом, который записывает эти точки.

Внутренние тесты Xiaomi показали, что преимущество MiMo Code перед Claude Code становилось заметнее после 200 шагов выполнения. При этом результаты были получены самой компанией и зависели от конфигурации.

Затем Xiaomi представила HarnessX — исследовательский фреймворк, в котором промты, системы памяти, инструменты и управляющая логика рассматриваются как компоненты, которые тоже можно переписывать и оптимизировать. По данным Xiaomi, при динамическом изменении оболочки средний абсолютный прирост составил 14,5% в 15 сочетаниях моделей и бенчмарков, без замены самой модели.

MiMo-V2.6 переносит эти направления непосредственно в процесс обучения модели.

Xiaomi потратила миллионы на обучение с подкреплением

Главная техническая часть V2.6 связана с обучением с подкреплением, или RL. На этом этапе модель выполняет задачи, получает награды или штрафы за качество результата и постепенно меняет поведение в пользу более успешных стратегий.

Масштабирование такого обучения дорого обходится: задачи ИИ-агентов могут включать длинные цепочки рассуждений, вызовы инструментов и проверку результата. Зато модель получает повторную практику выполнения сложной работы — планирования, использования инструментов, исправления ошибок и восстановления после неудачных стратегий — вместо обучения только на статических примерах.

По словам Xiaomi, MiMo-V2.6-Pro и MiMo-V2.6-Flash прошли по 30 крупных этапов обучения с подкреплением. За менее чем шесть дней они обработали около 750 000 траекторий. Затраты составили примерно $2,62 млн для Pro и $850 000 для Flash.

Технический отчёт показывает масштаб подробнее. На каждом этапе:

берутся 1 568 промтов;
для каждого создаются 16 вариантов траектории;
получается около 25 000 запусков;
генерируется от 2,7 млрд до 3,7 млрд обучающих токенов;
средняя длина последовательности составляет примерно от 110 000 до 150 000 токенов.

То есть Xiaomi в основном обучала модель не коротким ответам, а целым длинным рабочим процессам ИИ-агентов.

Расходы распределялись так:

43,5% стоимости RL для Pro — обучение;
43,8% — создание траекторий;
12,7% — их оценка.

Более половины бюджета ушло на получение и проверку опыта модели, ещё до превращения этого опыта в изменения весов.

Xiaomi называет стратегию «You Only RL Once». Вместо полностью отдельных программ обучения для программирования, работы с изображениями, управления компьютером и кибербезопасности компания объединила эти области и несколько оболочек ИИ-агентов в один большой запуск.

Разнообразие оболочек стало частью обучающей выборки. Xiaomi создала облегчённые «мини-оболочки» для:

программирования;
общих профессиональных рабочих процессов;
задач с изображениями;
кибербезопасности.

Так модель сталкивается с разными сочетаниями системных промтов, инструментов и способов управления контекстом и не привязывается к одной производственной оболочке.

Система использует полностью асинхронную оптимизацию политики с относительными групповыми преимуществами, или GRPO. Это важно для длительных задач: разные запуски завершаются в разное время. Xiaomi использует частично готовые траектории, чтобы не простаивали GPU, не дожидается самого медленного запуска, а прерывает незавершённые задачи и продолжает их позже.

Кроме того, компания создала механизм смешивания выборок. Он должен не позволять быстрым или простым группам задач заполнять каждый пакет и вытеснять более медленные.

Таким образом, масштабирование RL включает сразу несколько направлений:

число опытов, созданных моделью;
разнообразие сред, в которых эти опыты получены;
вычисления для определения поведения, которое действительно стоит усиливать.

Агент должен не только пройти тест

Последняя часть особенно важна для качества результатов.

Бинарная награда может показать, прошёл ли патч тесты, но не всегда различает два успешных решения. Одно может быть коротким и аккуратным, а другое — добавлять широкую резервную логику, ненужные изменения API или хрупкие обходные пути.

Поэтому Xiaomi создала две дополнительные системы наград.

1Groupwise Reward Synthesis, или GRS, формирует правила оценки для конкретной задачи, сравнивая несколько попыток её решения. Отдельно оцениваются качество реализации и поведение ИИ-агента:
выполнены ли требования;
обработаны ли редкие кейсы;
соблюдены ли особенности окружающей кодовой базы;
собраны и проверены ли необходимые доказательства.
2Groupwise Advantage Redistribution, или GAR, сравнивает успешные решения внутри одной группы запусков и направляет больше обучающего преимущества к лучшим из них.

Технический отчёт содержит эксперимент, показывающий эффект такого подхода. В запуске RL только для кода на MiMo-V2.6-Flash обучение без групповой онлайн-оценки быстро увеличивало число ходов ИИ-агента и длину генерируемого текста. В результате всё больше траекторий упирались в ограничения длины.

При включённом GAR доля успешных решений продолжала расти, но число ходов оставалось примерно стабильным, а длина текста увеличивалась постепенно.

Проверки, ориентированные на сопровождающих код, также показали различия. Политика, обученная без онлайн-оценки, всё чаще использовала:

предположительные ветки совместимости;
широкие экспорты;
подавление исключений;
ослабленную проверку;
изменения конфигурации специально под оценивание.

По данным Xiaomi, политика с групповой оценкой чаще создавала меньшие и более точные патчи.

Это связано с общей проблемой обучения ИИ-агентов с подкреплением: модель может научиться лучше максимизировать награду, но не стать лучше в работе, которую эта награда должна отражать.

Xiaomi подробно рассматривает эту проблему в разделе о взломе награды.

На ранних запусках для программирования агенты иногда находили способ не исправлять ошибку самостоятельно. Они могли:

скачать более новую версию пакета;
получить исходный файл из внешнего репозитория;
клонировать более позднее состояние репозитория;
найти уже опубликованное исправление в истории обсуждений.

Такие действия позволяли пройти тесты, но обходили саму задачу.

В ответ Xiaomi:

удалила из обучающих сред артефакты сборки и кэши;
убрала будущую историю Git;
заблокировала сетевой доступ к возможным источникам ответов;
запустила отдельного «агента для взлома», который должен был искать оставшиеся лазейки до начала обучения.

Во время финального запуска подтверждённые траектории со взломом награды составляли менее 2% и для Pro, и для Flash. Если проверяющая система обнаруживала такую траекторию, её эффективная награда обнулялась.

На таком масштабе задача машинного обучения становится тесно связана с распределёнными системами. Xiaomi пришлось одновременно поддерживать десятки тысяч длительных траекторий в неоднородных средах, не позволять быстрым задачам доминировать в пакетах, согласовывать поведение модели при обучении и инференсе и не допускать, чтобы более способные модели использовали слабости проверяющих систем.

В техническом отчёте также говорится, что во время RL Xiaomi заморозила маршрутизатор смеси экспертов, чтобы уменьшить дрейф обучения и повысить стабильность.

Фули Ло, бывшая исследовательница DeepSeek, возглавляющая команду Xiaomi MiMo, написала в X, что V2.6, вероятно, стала одним из крупнейших отдельных запусков обучения с подкреплением среди команд открытых моделей.

По её словам, Xiaomi направила на проект несколько десятков человек, а исследовательские и инженерные проблемы оказались сложнее тех, с которыми она сталкивалась при работе над DeepSeek R1. Она также объяснила, что в условиях острого дефицита вычислительных ресурсов компания всё равно решила надолго выделить команду из нескольких десятков специалистов для масштабирования RL.

Это соответствует техническому отчёту: значительная его часть посвящена не только алгоритму обучения, но и инфраструктуре, необходимой для стабильной работы RL.

Дэниш Хази, генеральный директор стартапа Paper Instruments, создающего инструменты для работы со знаниями на базе открытого ИИ, написал в X, что выпуск должен заставить исследователей пересмотреть прежние представления о законах масштабирования дообучения. Он отдельно отметил объём возможностей, который Xiaomi получила при сравнительно умеренных заявленных затратах на вычисления и полностью на китайских чипах, а не на GPU Nvidia.

Сильные агенты и новый лидер среди открытых моделей

Собственный набор бенчмарков Xiaomi показывает заметный рост по сравнению с V2.5:

71,9 на DeepSWE v1.1;
53,1 на AutomationBench;
76,9 на Toolathlon-Verified;
89,9 на Terminal Bench 2.1;
62,0 на JobBench;
94,0 на CyberGym;
72,3 на бенчмарке Xiaomi MiMo Visual Coding.

Закрытая Claude Opus 5 от Anthropic всё ещё опережает модель Xiaomi в нескольких оценках, о которых сообщила сама Xiaomi, включая DeepSWE v1.1, ProgramBench и Terminal Bench 4.0.

Закрытая GPT-5.6 Sol от OpenAI также лучше на некоторых тестах кибербезопасности, включая ExploitBench и SEC Bench Pro.

Динамика между версиями выглядит так:

DeepSWE v1.1: MiMo-V2.5-Pro выросла с 19,0 до 71,9;
AutomationBench: с 16,0 до 53,1;
MiMo Code Bench: с 40,4 до 63,2.

Речь не идёт о победе над всеми сильнейшими закрытыми моделями. Xiaomi приблизила открытую модель к передовому уровню, сохранив возможность скачать веса и заметно снизив стоимость эксплуатации.

Flash может оказаться важнее для массовых задач

Больше всего внимания естественно привлекает Pro, однако MiMo-V2.6-Flash может оказаться полезнее для компаний, которые запускают большое число вызовов ИИ-агентов.

Flash тоже построена как большая разреженная модель со смесью экспертов:

310 млрд параметров всего;
15 млрд активных во время инференса;
у Pro — 1,02 трлн параметров всего и 42 млрд активных.

Обе модели поддерживают контекст на 1 млн токенов, мультимодальный ввод и до 128 000 выходных токенов.

По нескольким агентским бенчмаркам Flash близка к Pro:

DeepSWE v1.1 — 67,9 против 71,9;
AutomationBench — 52,3 против 53,1;
MiMo Code Bench — 61,2 против 63,2;
Terminal Bench 2.1 — 87,6 против 89,9;
JobBench — 61,2 против 62,0;
MiMo Visual Coding — 71,5 против 72,3.

На CyberGym Flash даже опередила Pro: 95,1 против 94,0. Это не означает, что Flash в целом сильнее в кибербезопасности: на ExploitGym, ExploitBench и SEC Bench Pro преимущество остаётся у Pro.

Разница в стоимости значительно заметнее:

Flash — $0.14 за миллион входных токенов без кэширования и $0.28 за миллион выходных;
входные токены при попадании в кэш — $0.0028 за миллион;
Pro — $0.435 за миллион некэшированных входных токенов и $0.87 за миллион выходных;
входные токены Pro при попадании в кэш — $0.0036 за миллион.

Сравнение стоимости API передовых моделей за 1 млн токенов

Grok 4.7 Fast (Cursor) — более 256 000 входных токенов, до 500 000.

Таким образом, Flash примерно втрое дешевле Pro для некэшированных входных и выходных токенов, отставая от неё всего на несколько пунктов в ряде бенчмарков длительных задач ИИ-агентов.

Для рабочих нагрузок, где компания запускает тысячи или миллионы задач, разница может оказаться важнее небольшого разрыва в результатах. Речь идёт о помощниках для программирования, системах обработки документов, внутренних исследовательских агентах и автоматизированных офисных процессах.

Тим Деттмерс, профессор информатики в Университете Карнеги — Меллон, исследователь Allen Institute for Artificial Intelligence (Ai2) и создатель техники квантования LLM bitsandbytes, написал в X, что Flash производит хорошее впечатление и кажется лучшей моделью в классе от 300 до 550 млрд параметров. По его оценке, она превосходит DeepSeek v4.1 и GLM 5.3 Flash.

Xiaomi называет Flash моделью для «частых вызовов и крупных задач». Такое позиционирование объяснимо: технический результат V2.6 состоит не только в том, что триллионпараметрная Pro возглавила рейтинг открытых моделей. Компания, похоже, перенесла значительную часть тех же способностей ИИ-агента в более дешёвую модель с 15 млрд активных параметров.

Для разработчиков цена меняет практическое сравнение с закрытыми передовыми моделями. Модели не обязательно выигрывать каждый бенчмарк, если её возможностей хватает для конкретной работы, а запуск обходится значительно дешевле — особенно когда один ИИ-агент расходует сотни тысяч или миллионы токенов.

График соотношения цены и качества Artificial Analysis помещает MiMo-V2.6-Pro в верхнюю левую часть границы Парето по интеллекту и стоимости — между низкой ценой и высокой производительностью. Это поддерживает подход Xiaomi: V2.6 должна не только конкурировать за лидерство в бенчмарках, но и давать максимум полезных возможностей за каждый доллар.

OpenCode быстро отреагировала на эту экономику. В X сервис объявил, что MiMo-V2.6-Flash будет бесплатной в течение следующей недели. Обе модели — Flash и Pro — также доступны в сервисе Go.

От «вайб-кодинга» к Vibe World

Xiaomi показывает, как MiMo получает текст, изображения или видео и координирует работу нескольких агентов для создания игровых трёхмерных миров. Система строит сцены, реализует логику взаимодействия, проверяет отрендеренный результат и постепенно его улучшает.

В других демках модель:

создаёт объекты и сцены в Blender;
управляет программами на компьютере;
контролирует смоделированную роботизированную руку Franka Panda по визуальной обратной связи;
работает с дизайном интерфейсов;
взаимодействует с Figma;
создаёт презентации;
работает с SVG;
участвует в производстве видео;
сочиняет музыку.

На странице Pro Xiaomi описывает эти возможности как функции для профессиональных рабочих процессов, а не только как необычные демки. Среди целевых областей указаны программирование, офисная работа, дизайн, исследования, создание контента, кибербезопасность и управление компьютером.

В двух исследовательских примерах подход применяют к более сложным задачам.

В первом исследователи материалов из Xiaomi использовали MiMo-V2.6-Pro для анализа научных публикаций и патентов, предложения металлоорганических каркасов для улавливания PFAS — «вечных химикатов», — проведения вычислительных симуляций и отбора кандидатов для возможной проверки в лаборатории.

Во втором примере модель помогала исследователям формализовать в Lean 4 основную теорему из работы Li and Yorke «Period Three Implies Chaos». По данным Xiaomi, итоговый проект превысил 6 000 строк кода Lean и прошёл проверку ядром Lean без незавершённых мест в доказательстве.

Эти примеры не доказывают, что модель способна самостоятельно и надёжно проводить научные исследования. Они показывают тип задач, под который Xiaomi оптимизирует систему: длительные проекты, объединяющие рассуждение, программное обеспечение, инструменты, восприятие и многократную проверку результата, а не один промт и один ответ.

Xiaomi открывает не только веса моделей

Необычная часть выпуска — содержимое, которое Xiaomi публикует вместе с моделями.

Компания выпускает:

веса моделей Pro и Flash;
технический отчёт;
более 7 000 сред для задач RL;
сквозной фреймворк для обучения с подкреплением;
составные мини-оболочки;
MiMo-V2.6-Distill-Qwen-9B — меньшую модель, дистиллированную из траекторий MiMo RL.

Это больше, чем обычная публикация весов. В техническом отчёте десятки страниц посвящены созданию сред, разработке проверяющих систем, защите от взлома награды, асинхронной инфраструктуре запуска и смешиванию задач ИИ-агентов в одном обучении.

Xiaomi рассчитывает дать другим исследователям достаточно компонентов, чтобы воспроизвести и расширить её работу.

Для сообщества открытых моделей это может оказаться важнее, чем то, сколько недель или месяцев MiMo-Pro будет занимать первое место в рейтинге Artificial Analysis. Если независимые команды смогут перенести часть улучшений RL на меньшие модели, выпуск даст им практическую схему улучшения поведения ИИ-агентов без обучения ещё одной базовой модели на триллион параметров с нуля.

Более полный стек ИИ от Xiaomi

Общая картина становится всё заметнее. Xiaomi начала с базовых моделей, добавила агентов для длительных задач по программированию, перешла к адаптивным оболочкам и теперь раскрыла значительную часть инфраструктуры обучения с подкреплением, которая соединяет эти компоненты.

Компания по-прежнему не побеждает в каждом бенчмарке, а многие оценки её ИИ-агентов проводились самой Xiaomi. Триллионпараметрную Pro также непросто запускать самостоятельно, даже несмотря на то, что при обработке каждого токена активируется лишь часть параметров.

Одновременно Xiaomi теперь располагает:

моделью с самым высоким результатом среди открытых весов в сводном тесте интеллекта Artificial Analysis;
меньшей Flash, которая приближается к Pro в нескольких задачах ИИ-агентов примерно за треть цены API;
разрешительной лицензией;
растущим набором открытой инфраструктуры обучения.

Для корпоративных команд, работающих с ИИ, вопрос теперь состоит не в том, лучше ли MiMo-V2.6 абсолютно всех закрытых передовых моделей. Это не так.

Практический вопрос другой: сможет ли скачиваемая модель, достаточно близкая к ним на нужных рабочих нагрузках, заменить более дорогую закрытую систему хотя бы в части корпоративного стека ИИ-агентов. Для Pro это $0.87 за миллион выходных токенов, а для Flash — $0.28.

MiMo-V2.6 даёт разработчикам гораздо более вескую причину провести такую проверку.

Создатель магазинов Apple не верит в ставку Кремниевой долины на шопинг с ИИ Muse от Meta обгоняет ChatGPT на старте мобильного приложения Grok 4.7: кодинг лучше при той же доступной цене, но расход токенов угрожает окупаемости Googlebook за $899 — ставка Google на то, что вы купите новый ноутбук ради Gemini Meta теперь запрещает рекламу в поддержку феминизма OpenAI создала математический совет, пока её ИИ решает свыше 100 открытых задач Бристольские исследователи: медицина уже умеет работать с чёрными ящиками — ИИ может учиться Сотни рейсов встали на восточном побережье: власти запускают ИИ для авиадиспетчеров ИИ, пошлины и редкие минералы: чего ждать от саммита Трампа и Си Цзиньпина Amazon заблокировала ИИ-агента Meta Muse в онлайн-магазине ИИ-агент Meta заблокировали на Amazon.com Научная панель ООН: нет уверенности, что люди сохранят контроль над ИИ-агентами Признаки кризиса в Flock: сотрудникам предлагают выплаты за уход С Tabby бывший бухгалтер с помощью ИИ делает бухгалтеров ненужными Поставщиков услуг в Великобритании призвали перестать полагаться на чат-ботов в поддержке клиентов Она умерла у границы Сан-Диего. Камера наблюдения была у всех на виду xAI представила Grok 4.7 по низкой цене, но тесты показали большой разрыв с Claude и GPT-6 Почему я не боюсь, что ИИ нас всех убьёт (и вам тоже не стоит) США потратили миллиарды на наблюдение за границей. Почему людей не находят до смерти? ByteDance запустила Dramagic — ИИ-платформу для коротких сериалов от сценария до экрана

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram