Qwen-Drive 1.0 решает три задачи в рамках одной модели: распознаёт пространственную структуру окружающей среды, отвечает на вопросы о дорожном движении и прокладывает маршрут. Исследователи подтверждают: способность текстово-визуальной модели подробно описывать изображение сама по себе не означает, что она понимает трёхмерное пространство.
Как устроена модель
Существующие модели для вождения обычно создают на основе универсальной текстово-визуальной модели, которую дообучают на данных о дорожных ситуациях — главным образом на парах вопросов и ответов. В статье указаны две проблемы такого подхода:
Исследовательское подразделение Alibaba создало модель, которая должна решить обе проблемы.
Qwen-Drive 1.0 построена на Qwen3.5-4B, выпущенной в феврале, и дополнена двумя компонентами. Первый создаёт вид сверху на окружение: обнаруживает объекты в 3D-пространстве, определяет занятые области и восстанавливает форму дороги. По словам исследователей, этот компонент одновременно служит измерительным инструментом: он показывает, сколько пространственной информации модель действительно извлекает из изображений.
Все функции управления автомобилем выполняются через общую языковую модель. Два добавленных модуля используют её промежуточные результаты: один строит 3D-модель окружающей обстановки, а другой планирует маршрут автомобиля на следующие несколько секунд
Источник: the-decoder.com
Второй компонент, Planning Expert, использует внутренние данные модели для планирования будущего движения автомобиля. Когда исследователи обучали только добавленный компонент, оставляя текстово-визуальную модель без изменений, точность пространственного восприятия оставалась низкой. Это подтвердило, что модель может подробно описывать изображения, но при этом не понимать трёхмерное пространство. Существенный рост показателей появился только после того, как текстово-визуальную часть также обучили на пространственных задачах: способность понимать дорожные сцены приходится формировать намеренно.

В собственных тестах Qwen Qwen-Drive 1.0 превосходит специализированные модели в большинстве категорий, связанных с вождением и восприятием
Источник: the-decoder.com
Модель восстанавливает вид каждой сцены сверху по изображениям с камер, показывая автомобили, пешеходов и дорожную разметку. Справа прогноз показан рядом с реальной ситуацией
Источник: the-decoder.com

В каждом сценарии модель объясняет принятое решение, например торможение перед животным на дороге или остановку на красный свет. Синяя линия показывает запланированный маршрут
Источник: the-decoder.com
Обучение проходит в несколько этапов:

При обработке видеозаписей с других автомобилей с иными конфигурациями камер модель обнаруживает значительно меньше объектов. Подходящих обучающих данных для таких конфигураций по-прежнему не хватает
Источник: the-decoder.com
Для текстово-визуального компонента команда объединила 24 общедоступных набора данных с дорожными сценами. У этих наборов отличались форматы, а в некоторых встречались ошибки. ИИ-модель привела вопросы и ответы к единому виду и сопоставила их с исходными данными. Кроме того, команда подготовила собственные примеры, объясняющие, почему автомобиль должен принять конкретное решение — например, какой объект должен вызвать торможение.
Одна модель для салона и дороги
В современных автомобилях информационно-развлекательная система и система вождения объединяются в одном вычислительном блоке вместо двух отдельных контроллеров. Авторы считают, что модель, пожертвовавшая общими способностями ради результатов в управлении автомобилем, плохо подходит для такой архитектуры: тогда салону всё равно потребовалась бы отдельная модель и дополнительные вычислительные ресурсы для диалога и открытых вопросов.
Согласно статье, Qwen-Drive 1.0 заметно превосходит исходную Qwen3.5-4B в вопросах о дорожных сценах. Самый большой разрыв появляется в задачах на причинно-следственные объяснения — например, когда нужно сказать, почему автомобиль должен затормозить или повернуть. Общие знания при этом сохраняются: на тестах, не связанных с вождением, модель почти не теряет исходные показатели, а на некоторых пространственных задачах даже набирает немного больше.
От симуляции к дороге
Для проверки планирования движения команда использовала несколько уровней сложности — от простых предсказаний до симулятора, где ошибки накапливаются со временем. В симуляции версия, дообученная с помощью вознаграждений, снизила долю выездов машины за пределы дороги с 24% до 12%. При этом автомобиль стал двигаться осторожнее и в целом преодолел меньшее расстояние.
Однако объяснения модели не всегда указывают настоящую причину ситуации. Красный сигнал светофора вдали и ребёнок, выбежавший на дорогу, требуют разного времени реакции, но модель способна смешать эти случаи. Запланированный манёвр также не всегда совпадает с рассуждением, которое модель выдала заранее.
Часть результатов основана на тестовых процедурах, разработанных или заново собранных самими авторами. Поэтому отдельные метрики мало говорят о том, как система поведёт себя в сложной реальной дорожной обстановке.
Команда Qwen отдельно измерила разрыв в пространственном понимании с помощью собственного бенчмарка HopChain. В нём текстово-визуальные модели ошибались в классификации объектов и путали пространственные отношения, хотя хорошо проходили бенчмарки на сопоставление изображений и текста.
Катастрофическое забывание тоже остаётся известной проблемой. В 2023 году Google DeepMind создала PaLM-E — модель для работы с языком, изображениями и управлением роботами. После обучения на робототехнических данных небольшие версии потеряли значительную часть языковых способностей. Крупнейшая версия с 562 млрд параметров почти ничего не потеряла.
Объединение языковой модели с функцией управления автомобилем создаёт и новый вектор атак. Исследователи из UC Santa Cruz разместили в поле зрения камеры знак с надписью и заставили систему вождения DriveLM резко повернуть в сторону пешеходов, переходивших дорогу, хотя сама система правильно обнаружила этих людей.
Исследования тем временем смещаются к World Action Models — моделям, которые также предсказывают, как окружающая среда изменится в ответ на собственные действия агента.
Команда Qwen бесплатно открывает модель для исследовательского сообщества на Hugging Face, ModelScope и GitHub.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram