i
ДАТАИСТ
Новости · 2026-09-07

Qwen-Drive 1.0 объясняет, почему тормозит, но её объяснения могут расходиться с манёврами

@neuronium_ai @neuronium_ai

Alibaba представила Qwen-Drive 1.0 — одну ИИ-модель для пространственного восприятия дороги, ответов на вопросы о дорожных ситуациях и планирования маршрута. К базовой Qwen3.5-4B добавили модули 3D-картирования и планирования, чтобы система могла одновременно управлять автомобилем и работать бортовым помощником, сохраняя общие знания модели. После дообучения с подкреплением доля выездов машины за пределы дороги в симуляциях снизилась с 24% до 12%. Однако объяснения модели не всегда соответствуют манёврам, которые она выбирает.

Обложка: Qwen-Drive 1.0 объясняет, почему тормозит, но её объяснения могут расходиться с манёврами

Qwen-Drive 1.0 решает три задачи в рамках одной модели: распознаёт пространственную структуру окружающей среды, отвечает на вопросы о дорожном движении и прокладывает маршрут. Исследователи подтверждают: способность текстово-визуальной модели подробно описывать изображение сама по себе не означает, что она понимает трёхмерное пространство.

Как устроена модель

Существующие модели для вождения обычно создают на основе универсальной текстово-визуальной модели, которую дообучают на данных о дорожных ситуациях — главным образом на парах вопросов и ответов. В статье указаны две проблемы такого подхода:

модель, обученная преимущественно на вопросах о дорожном движении, не всегда надёжно определяет расстояния, положение объектов и свободное пространство;
при чрезмерной специализации на данных о вождении она теряет часть общих знаний, полученных во время исходного обучения. Исследователи называют это катастрофическим забыванием, а утраченные знания особенно важны в редких и неожиданных дорожных ситуациях.

Исследовательское подразделение Alibaba создало модель, которая должна решить обе проблемы.

Qwen-Drive 1.0 построена на Qwen3.5-4B, выпущенной в феврале, и дополнена двумя компонентами. Первый создаёт вид сверху на окружение: обнаруживает объекты в 3D-пространстве, определяет занятые области и восстанавливает форму дороги. По словам исследователей, этот компонент одновременно служит измерительным инструментом: он показывает, сколько пространственной информации модель действительно извлекает из изображений.

Все функции управления автомобилем выполняются через общую языковую модель. Два добавленных модуля используют её промежуточные результаты: один строит 3D-модель окружающей обстановки, а другой планирует маршрут автомобиля на следующие несколько секунд

Все функции управления автомобилем выполняются через общую языковую модель. Два добавленных модуля используют её промежуточные результаты: один строит 3D-модель окружающей обстановки, а другой планирует маршрут автомобиля на следующие несколько секунд

Источник: the-decoder.com

Второй компонент, Planning Expert, использует внутренние данные модели для планирования будущего движения автомобиля. Когда исследователи обучали только добавленный компонент, оставляя текстово-визуальную модель без изменений, точность пространственного восприятия оставалась низкой. Это подтвердило, что модель может подробно описывать изображения, но при этом не понимать трёхмерное пространство. Существенный рост показателей появился только после того, как текстово-визуальную часть также обучили на пространственных задачах: способность понимать дорожные сцены приходится формировать намеренно.

В собственных тестах Qwen Qwen-Drive 1.0 превосходит специализированные модели в большинстве категорий, связанных с вождением и восприятием

В собственных тестах Qwen Qwen-Drive 1.0 превосходит специализированные модели в большинстве категорий, связанных с вождением и восприятием

Источник: the-decoder.com

Модель восстанавливает вид каждой сцены сверху по изображениям с камер, показывая автомобили, пешеходов и дорожную разметку. Справа прогноз показан рядом с реальной ситуацией

Модель восстанавливает вид каждой сцены сверху по изображениям с камер, показывая автомобили, пешеходов и дорожную разметку. Справа прогноз показан рядом с реальной ситуацией

Источник: the-decoder.com

В каждом сценарии модель объясняет принятое решение, например торможение перед животным на дороге или остановку на красный свет. Синяя линия показывает запланированный маршрут

В каждом сценарии модель объясняет принятое решение, например торможение перед животным на дороге или остановку на красный свет. Синяя линия показывает запланированный маршрут

Источник: the-decoder.com

Обучение проходит в несколько этапов:

При обработке видеозаписей с других автомобилей с иными конфигурациями камер модель обнаруживает значительно меньше объектов. Подходящих обучающих данных для таких конфигураций по-прежнему не хватает

При обработке видеозаписей с других автомобилей с иными конфигурациями камер модель обнаруживает значительно меньше объектов. Подходящих обучающих данных для таких конфигураций по-прежнему не хватает

Источник: the-decoder.com

сначала обучают модуль восприятия;
затем объединяют восприятие и ответы на вопросы;
после этого добавляют планирование маршрута;
на последнем этапе поведение модели улучшают с помощью обучения с подкреплением.

Для текстово-визуального компонента команда объединила 24 общедоступных набора данных с дорожными сценами. У этих наборов отличались форматы, а в некоторых встречались ошибки. ИИ-модель привела вопросы и ответы к единому виду и сопоставила их с исходными данными. Кроме того, команда подготовила собственные примеры, объясняющие, почему автомобиль должен принять конкретное решение — например, какой объект должен вызвать торможение.

Одна модель для салона и дороги

В современных автомобилях информационно-развлекательная система и система вождения объединяются в одном вычислительном блоке вместо двух отдельных контроллеров. Авторы считают, что модель, пожертвовавшая общими способностями ради результатов в управлении автомобилем, плохо подходит для такой архитектуры: тогда салону всё равно потребовалась бы отдельная модель и дополнительные вычислительные ресурсы для диалога и открытых вопросов.

Согласно статье, Qwen-Drive 1.0 заметно превосходит исходную Qwen3.5-4B в вопросах о дорожных сценах. Самый большой разрыв появляется в задачах на причинно-следственные объяснения — например, когда нужно сказать, почему автомобиль должен затормозить или повернуть. Общие знания при этом сохраняются: на тестах, не связанных с вождением, модель почти не теряет исходные показатели, а на некоторых пространственных задачах даже набирает немного больше.

От симуляции к дороге

Для проверки планирования движения команда использовала несколько уровней сложности — от простых предсказаний до симулятора, где ошибки накапливаются со временем. В симуляции версия, дообученная с помощью вознаграждений, снизила долю выездов машины за пределы дороги с 24% до 12%. При этом автомобиль стал двигаться осторожнее и в целом преодолел меньшее расстояние.

До дообучения24% выездов за дорогу
После дообучения12% выездов за дорогу

Однако объяснения модели не всегда указывают настоящую причину ситуации. Красный сигнал светофора вдали и ребёнок, выбежавший на дорогу, требуют разного времени реакции, но модель способна смешать эти случаи. Запланированный манёвр также не всегда совпадает с рассуждением, которое модель выдала заранее.

Часть результатов основана на тестовых процедурах, разработанных или заново собранных самими авторами. Поэтому отдельные метрики мало говорят о том, как система поведёт себя в сложной реальной дорожной обстановке.

Команда Qwen отдельно измерила разрыв в пространственном понимании с помощью собственного бенчмарка HopChain. В нём текстово-визуальные модели ошибались в классификации объектов и путали пространственные отношения, хотя хорошо проходили бенчмарки на сопоставление изображений и текста.

Катастрофическое забывание тоже остаётся известной проблемой. В 2023 году Google DeepMind создала PaLM-E — модель для работы с языком, изображениями и управлением роботами. После обучения на робототехнических данных небольшие версии потеряли значительную часть языковых способностей. Крупнейшая версия с 562 млрд параметров почти ничего не потеряла.

Объединение языковой модели с функцией управления автомобилем создаёт и новый вектор атак. Исследователи из UC Santa Cruz разместили в поле зрения камеры знак с надписью и заставили систему вождения DriveLM резко повернуть в сторону пешеходов, переходивших дорогу, хотя сама система правильно обнаружила этих людей.

Исследования тем временем смещаются к World Action Models — моделям, которые также предсказывают, как окружающая среда изменится в ответ на собственные действия агента.

Команда Qwen бесплатно открывает модель для исследовательского сообщества на Hugging Face, ModelScope и GitHub.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram