i
Новости
Новости · 2026-09-23

Black Forest Labs представила FLUX 3 Action — ИИ-модель для робототехники с открытыми весами, лидирующую при вдвое меньшем размере

@neuronium_ai @neuronium_ai

Немецкая компания Black Forest Labs представила FLUX 3 Action — открытую модель мира и действий для робототехники с 7 млрд параметров. Она принимает изображения с камер, текущее состояние робота и инструкции на естественном языке, а затем переводит их в физические действия. На бенчмарке NVIDIA RoboLab-120 модель получила 42,92% успешных выполнений и заняла бы первое место в публичном рейтинге. При этом FLUX 3 Action содержит 44% от числа параметров NVIDIA Cosmos3-Nano-Policy и работает в 1,43 раза быстрее. BFL также проверяет архитектуру в симуляциях, играх и управлении компьютером, а веса, код, рецепт файн-тюнинга и воспроизводимые примеры собирается открыть.

Обложка: Black Forest Labs представила FLUX 3 Action — ИИ-модель для робототехники с открытыми весами, лидирующую при вдвое меньшем размере

BFL сообщает, что обучила специализированные варианты FLUX 3 Action управлять дронами в реальном мире. Один из вариантов также смог пройти компьютерную игру «Doom» без единой смерти персонажа: модель управляла видом от первого лица и оружием героя.

Компания называет эти результаты ранними экспериментами, а не возможностями готового продукта.

В интервью VentureBeat BFL заявила, что опубликует:

веса модели;
исходный код;
рецепт файн-тюнинга;
бенчмарки;
воспроизводимые примеры;
реализацию для недорогого робота SO-101 с фреймворком LeRobot от Hugging Face.

Команды смогут дополнительно обучать модель на демонстрациях, собранных собственными роботами.

BFL впервые показала FLUX 3 Action в июле, когда представила семейство FLUX 3. Тогда Action была доступна только отдельным исследовательским и коммерческим партнёрам, а более широкую открытую модель FLUX 3 Dev обещали выпустить позднее.

Результат на RoboLab

RoboLab — разработанный NVIDIA симуляционный бенчмарк для проверки универсальных робототехнических политик на 120 задачах. Он охватывает визуальное понимание, рассуждение об отношениях между объектами и процедурные навыки. У задач есть разные уровни сложности и варианты формулировок с различной точностью описания.

NVIDIA создавала RoboLab в том числе для борьбы с насыщением старых бенчмарков: по мере улучшения моделей они перестают достаточно хорошо различать результаты.

По данным BFL, FLUX 3 Action набрала 42,92% — на 6,1 процентного пункта больше, чем Cosmos 3, прежняя открытая модель с лучшим результатом на RoboLab. У Cosmos3-Nano-Policy 16 млрд параметров, у FLUX 3 Action — 7 млрд.

42,92%результат FLUX 3 Action на RoboLab-120
7 млрдпараметров FLUX 3 Action
16 млрдпараметров Cosmos3-Nano-Policy
1,43 разапреимущество в скорости

Картина меняется, если учитывать не только рейтинг RoboLab. Непосредственно перед выходом FLUX 3 Action первое место в общем зачёте RoboLab-120 занимала OASIS WAM с результатом 39,0%. FLUX 3 Action всё равно оказалась выше.

Сравнение размеров существенно именно в паре с Cosmos, но на всём рынке робототехнических моделей FLUX 3 Action не относится к самым маленьким. У MolmoAct 2 от Ai2 около 5 млрд параметров, а NVIDIA распространяет контрольную точку GR00T N1.7 с 3 млрд параметров.

Заявление BFL касается другого: более высокий результат на RoboLab получен при заметно меньшем числе параметров, чем у конкретной открытой модели мира и действий, которая прежде возглавляла этот бенчмарк.

MolmoAct 2, новые версии GR00T от NVIDIA и другие робототехнические модели проверяются на иных сочетаниях реальных и симулированных задач. Поэтому сейчас они не отображаются рядом с FLUX 3 Action в RoboLab.

Из-за этого прямые численные сравнения затруднены. В робототехнике исследовательские группы могут использовать совершенно разное оборудование, распределение задач, демонстрации и среды оценки.

BFL отдельно подчёркивает скорость инференса. В предоставленных компанией результатах модели сравниваются по коэффициенту реального времени — отношению задержки инференса к продолжительности создаваемого роботом действия в реальном мире. Чем ниже показатель, тем меньше вычислительного времени модель тратит на выбор следующего действия по сравнению с продолжительностью управляемого движения.

По словам BFL, дистиллированные варианты FLUX 3 Action формируют новую границу Парето по сочетанию успешности на RoboLab и скорости инференса на серверных GPU. Компания также утверждает, что модель превосходит π0.5 по коэффициенту реального времени и при этом заметно чаще успешно выполняет задачи.

Для развёртывания это имеет практическое значение: модель, которая хорошо проходит бенчмарк, но не успевает постоянно выдавать действия, может вызывать паузы, рывки и запаздывание реакции. При этом новый результат FLUX BFL предоставила до публикации, а на момент проверки перед запуском публичный рейтинг NVIDIA ещё не содержал FLUX 3 Action.

Сравниваемые модели относятся к разным категориям. BFL и NVIDIA называют FLUX 3 Action и Cosmos 3 моделями мира и действий — они связывают прогноз изменений в окружающей среде с генерацией действий.

π0.5 от Physical Intelligence и семейство GR00T от NVIDIA относятся к зрительно-языково-действенным моделям. Ai2 называет MolmoAct 2 моделью рассуждения о действиях. Все эти системы могут решать пересекающиеся задачи роботизированных манипуляций, но обучаются и генерируют действия не обязательно одинаково.

Источник: venturebeat.com

Прогноз следующего шага

Архитектура FLUX 3 Action продолжает направление, которое BFL развивала значительную часть этого года. Компания исходит из того, что модель, достаточно глубоко обученная на видео, может научиться полезным представлениям движения, контакта, поведения объектов и причинно-следственных связей. Затем эти представления можно адаптировать для управления роботами.

FLUX 3 Action использует предобучение на изображениях, видео и аудио из FLUX 3, но построена на меньшей архитектуре, оптимизированной для практического развёртывания. На дополнительном этапе обучения модель одновременно учится предсказывать будущие кадры видео и действия.

Во время инференса она получает недавние кадры с камер, состояние системы и описание задачи. В ответ модель выдаёт следующие 32 действия и прогноз того, как изменится визуальная сцена. После этого робот снова наблюдает обновлённую среду, и цикл повторяется.

Подход восходит к исследованию BFL под названием Self-Flow. Оно направлено на то, чтобы генеративная модель одновременно училась создавать данные и получать полезные представления своих входов. Ранее VentureBeat описывал Self-Flow как попытку BFL отказаться от отдельных замороженных моделей представлений, таких как CLIP или DINO. Позднее компания масштабировала эту работу в FLUX 3.

BFL уже открыла код инференса Self-Flow и контрольную точку для ImageNet по лицензии Apache 2.0. Полный код обучения и контрольная точка видеомодели пока не опубликованы.

Связь между генерацией и робототехникой была заметна и в FLUX-mimic — проекте, созданном совместно со швейцарским стартапом mimic robotics. BFL сообщала, что прежняя система использовала представления из видеобэкенда FLUX 3 для управления роботами при промышленных манипуляциях. Её проверяли в производственных средах Audi.

FLUX 3 Action переносит этот подход в модель, которую смогут самостоятельно адаптировать другие команды, занимающиеся робототехникой.

По данным BFL, политика, показанная в новых демонстрациях, была дообучена примерно на 200 эпизодах телеуправления. Они охватывали несколько связанных задач по перемещению объектов. Компания утверждает, что предметы из тестовых видео не входили в обучающую выборку.

В одной из демонстраций робот сначала ошибается, а затем повторяет попытку. В сопроводительной расшифровке исследователи описали это как ситуацию, когда модель сперва не справилась, а потом попробовала снова и выполнила задачу лучше.

Это демонстрация, выбранная самой компанией, а не доказательство того, что самостоятельное исправление ошибок обобщается на разные роботы и среды. Однако она показывает поведение, которое BFL рассчитывает получить от предварительно обученной модели мира без необходимости заранее демонстрировать команде каждый возможный сценарий сбоя.

BFL не единственная компания, считающая, что широкое предварительное обучение способно уменьшить объём данных, необходимых для конкретного робота. Google DeepMind заявляет, что её закрытая зрительно-языково-действенная модель Gemini Robotics On-Device 2 может адаптироваться к новым типам роботов менее чем на 200 примерах. Доступ к ней пока ограничен доверенными тестировщиками.

Среди открытых решений наиболее близким сопоставлением для стратегии BFL может быть MolmoAct 2 от Ai2. Ai2 опубликовала не только веса модели, но и:

код обучения;
скрипты файн-тюнинга;
наборы данных;
результаты запусков для оценки;
интеграцию с LeRobot.

Ai2 сообщает о среднем результате 87,1% на пяти собственных задачах оценки с реальным роботом Franka. Для π0.5 компания приводит 45,2%. Напрямую сопоставлять эти показатели с процентами RoboLab нельзя: наборы задач и методики оценки различаются.

Для разработчиков это означает, что в робототехнике по-прежнему нет единого бенчмарка, который позволял бы честно определить лидера сразу по симуляциям, реальному оборудованию, разным типам роботов и разным видам манипуляций. Результат FLUX 3 Action определяет её позицию на RoboLab, но не закрывает более широкий спор между моделями мира и действий, зрительно-языково-действенными моделями и моделями рассуждения о действиях.

От генерации изображений к физическому ИИ

FLUX 3 Action показывает, как быстро расширилась сфера работы BFL после появления компании в 2024 году.

Стартап основали исследователи, работавшие над технологиями латентной диффузии и Stable Diffusion. Сначала компания получила известность благодаря семейству моделей изображений FLUX.1. Затем BFL запустила коммерческий API с FLUX1.1 Pro и расширила стратегию открытого ядра семейством FLUX.2, включая небольшие модели [klein], рассчитанные на быстрый инференс и локальное развёртывание.

В декабре 2025 года BFL привлекла $300 млн в раунде Series B при оценке после инвестиций в $3,25 млрд. Общий объём финансирования компании превысил $450 млн. BFL работает во Фрайбурге и Сан-Франциско.

FLUX 3 Video стала общедоступной через API BFL в августе. Тариф с оплатой по мере использования начинается с $0,06 за секунду для Draft HD, составляет $0,17 за секунду для стандартного HD и $0,29 за секунду для генерации видео из текста или изображения в разрешении FHD. Теперь BFL также предлагает повышение разрешения видео через отдельную конечную точку.

В материалах о FLUX 3 Action пока нет объявления об отдельном API, ценах на API или конкретной коммерческой лицензии для весов. На момент публикации публичная страница BFL о FLUX 3 по-прежнему сообщала, что Action распространяется через отдельных исследовательских и коммерческих партнёров. В документации компании FLUX 3 также в основном представлена как API для генерации видео, без отдельной конечной точки FLUX 3 Action.

Поэтому сейчас основная возможность для робототехнических команд — самостоятельный запуск и дообучение модели.

FLUX 3 Action выходит в экосистеме открытых или доступных для загрузки робототехнических решений:

GR00T N1.7 от NVIDIA — открытая зрительно-языково-действенная модель с 3 млрд параметров, выпущенная в апреле. Она ориентирована прежде всего на универсальные гуманоидные системы и перенос манипуляций между разными типами роботов. Модель можно дополнительно обучать под конкретных роботов, задачи и среды.
MolmoAct 2 от Ai2 — модель, выпущенная в мае и также рассчитанная на локальную адаптацию. Она напрямую интегрирована с LeRobot.
Gemini Robotics On-Device 2 от Google — закрытое решение, представленное в июле. Модель предназначена для локального запуска на робототехническом оборудовании, но Google распространяет её только среди отдельных тестировщиков и не публикует веса.

Возможно, именно здесь окажется главное практическое значение выпуска. BFL предлагает не обучать большую базовую робототехническую модель с нуля, а взять сравнительно компактную систему с широкими визуальными и физическими представлениями, собрать демонстрации на собственном оборудовании и адаптировать модель к сортировке, сборке, упаковке, навигации и задачам по перемещению объектов.

Открытые веса дают командам и другую возможность по сравнению с облачными робототехническими сервисами: они смогут проверять и менять модель, запускать инференс в собственной инфраструктуре и потенциально хранить закрытые демонстрации роботов и эксплуатационные данные внутри своей среды. Насколько свободным с коммерческой точки зрения будет такой вариант, зависит от окончательных условий лицензии BFL.

Результаты бенчмарка показывают, что такой подход может быть конкурентоспособным в симуляции. Более широкий вопрос теперь состоит не только в том, способна ли FLUX 3 Action обойти конкретную модель в одном рейтинге. Важно, сможет ли сочетание предварительного обучения на данных о мире, размера 7 млрд параметров, открытых весов и удобного рабочего процесса дообучения оказаться полезным для множества реальных роботов, с которыми работают разработчики.

Следующая проверка — смогут ли внешние команды воспроизвести эти результаты на собственных роботах и сделают ли меньший размер и открытые веса FLUX 3 Action достаточно практичной для промышленного применения.

Источник: venturebeat.com

YouTube добавила в Creator Studio ИИ для сценариев, умных обложек и монтажа Gemini Stanford University уличили в плакатах с созданной ИИ фальшивой темнокожей студенткой по кампусу Сообщество ИИ связывают с тревожной культурой сексуального насилия Перенос инференса для физических ИИ-роботов в реальном мире YouTube Music станет более разговорным благодаря новым функциям ИИ Инженер Anthropic объяснил, почему Claude стал хуже писать, хотя поумнел Агенты OpenAI решили одну из сложнейших задач — математики не понимают их «доказательство» Ситуационный отчёт Первый робот PitPro для замены шин заработал в Канаде Ema привлекла $77 млн — ИИ начинает теснить корпоративное ПО и услуги Как устроен Basecamp Research — ИИ-стартап, превращающий эволюцию в данные для обучения Spotify даёт ключи от алгоритма рекомендаций: в США запустили Taste Profile ИИ-помощник Meta Muse вышел с серьёзной уязвимостью безопасности Alibaba выпустила Qwen Audio 3.1 и новые модели, снизив цены на ИИ-аудио максимум на 95% Инженер: ИИ сеет хаос — кодеры весь день жмут «Enter», не думая и не понимая код AT&T автоматизацией избавляется от рабочих мест — и старой телеком-империи Умные очки Meta уже сеют хаос в Индии OpenAI наняла сооснователя Patreon Сэма Яма во главе нового подразделения Creator Product «Мы уже сражаемся в битве вчерашнего дня»: премьер Греции откровенно об ИИ Бёрнэм: новое британское ведомство даст отпор «информационной войне» России и других стран

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram