Qwen-UI-Agent: ИИ-агент, который пользуется телефоном и компьютером
Все хотят универсального ИИ-агента. Такого, которому можно сказать: «Разберись». Он сам откроет приложения, найдёт нужные кнопки, сравнит варианты, поправит файл на компьютере, а если прилетело уведомление об отмене рейса — предложит готовый план действий.
Проблема в том, что почти все такие демки хорошо выглядят на вылизанных тестах и заметно хуже — в живых приложениях. На настоящем смартфоне всё мешает: всплывающие окна, слетевшие логины, капча, странная вёрстка, медленная сеть, неожиданные экраны подтверждения. На компьютере другая проблема: одних кликов мало. Иногда быстрее и надёжнее сделать часть работы через командную строку.
Именно эту проблему решает команда Alibaba в большом техническом отчёте про Qwen-UI-Agent. Это ИИ-агент для графических интерфейсов, который работает сразу в нескольких средах: на телефоне, на компьютере, в браузере и в режиме поиска по интернету. Если вы хотите полезного ИИ-агента, мало обучить модель нажимать на кнопки. Нужно строить всю систему целиком — среду, данные, обучение, проверку и продуктовую обвязку.
Что здесь сделали
Qwen-UI-Agent — это не просто ещё одна модель, которая умеет кликать по экрану. Это целый стек.
🟠 Агент работает с мобильными приложениями, настольными программами, браузером и внешними сервисами поиска.
🟠 Он умеет не только нажимать и печатать в интерфейсе, но и выполнять команды в командной строке, а также обращаться к API.
🟠 Он может выдавать не одно действие за шаг, а пачку действий, если между ними не нужно каждый раз ждать новый экран.
🟠 Его обучали не только на коротких сценариях, но и на длинных траекториях — больше 100 шагов.
🟠 Поверх агента есть отдельный слой, который позволяет запускать задачи по уведомлениям и переносить работу между телефоном и компьютером.
У обычных демо ИИ-агентов часто одна и та же слабость: они выглядят как набор отдельных фокусов. Здесь авторы пытаются собрать из этого рабочую операционную систему для агента.
Почему упор на реальные устройства
Разрыв между симуляцией и реальностью для мобильных агентов большой.
В песочнице всё удобно. Приложение можно сбросить в начальное состояние. Нужные данные уже лежат на месте. Нет внезапной капчи. Нет рекламы. Нет нестабильной сети. Но пользователь живёт не в песочнице.
Авторы поэтому построили парк из более чем 100 физических телефонов и более 150 приложений. Это не просто набор гаджетов на столе. Там есть диспетчер, который следит, какой телефон исправен, где какой аккаунт залогинен, какая сеть доступна, где сломалась среда, а где ошибся сам агент.
Система умеет различать ошибку модели и ошибку среды. Если приложение зависло или сеть отвалилась, это не должно записываться в промах агента. Для этого они отдельно анализируют полную траекторию выполнения.
Отсюда же появился новый бенчмарк MobileWorld-Real — 409 задач в 104 приложениях на живых Android-устройствах. Это один из вкладов работы. Он показывает, насколько тяжело ИИ-агенту в обычной мобильной жизни. И именно там Qwen-UI-Agent набрал 92,2% успешных выполнений. Для сравнения, у закрытых моделей результат ниже: Gemini 3.1 Pro — 86,2%, GPT-5.6 Sol — 85,4%, Claude Opus 4.8 — 84,7%.
Это проверка того, переносится ли навык из лаборатории на реальный экран.
Как агент действует: интерфейс, командная строка и пачки действий
У Qwen-UI-Agent единое пространство действий. Он может:
🟣 кликать, свайпать, печатать, открывать приложения и нажимать системные кнопки;
🟣 выполнять команды в командной строке;
🟣 вызывать API;
🟣 спрашивать пользователя, если нужно подтверждение или не хватает данных;
🟣 завершать задачу с результатом.
На бумаге это выглядит очевидно. Вместо логики «всё делаем только мышкой и глазами» здесь есть несколько способов действия. Но часть задач через интерфейс делать долго и бессмысленно.
Пример из статьи: если надо найти правильную фотографию среди множества похожих, агент не открывает каждую по отдельности. Он может одной командой в командной строке собрать коллаж из миниатюр, быстро посмотреть на него, а потом уже через интерфейс выбрать нужное. То есть командная строка становится быстрыми руками, а графический интерфейс — глазами для проверки.
Это даёт два эффекта сразу.
🟠 Задачи решаются быстрее, потому что часть рутины уходит в командную строку.
🟠 Агент покрывает больше типов задач: от визуальной навигации до обработки файлов и данных.
Ещё одна деталь — пакетные действия. Если агент понимает, что может подряд сделать несколько предсказуемых шагов, он не тратит отдельный шаг модели на каждый клик. Например, открыть поиск по странице, ввести запрос и нажать Enter. Или пройти длинную последовательность заполнения формы, пока не появится место, где снова нужно подумать.
На сложном компьютерном бенчмарке OSWorld-v2 это дало заметную экономию шагов. У Qwen-UI-Agent среднее число шагов на задачу — 135,8. Это меньше, чем у ряда открытых моделей, которые тратят 170–320 шагов.
Как его обучали
Архитектура здесь интересна, но основной вклад всё же в дата-пайплайн и обучение.
Сначала авторы собирают данные для обучения с учителем: траектории, где агент шаг за шагом решает задачи. Но они не полагаются только на ручную разметку. У них есть автоматический цикл улучшения данных — своего рода маховик.
Схема примерно такая:
🟣 сильные модели помогают придумывать новые задачи;
🟣 агенты создают состояния среды под эти задачи;
🟣 затем другие агенты или проверяющие модели анализируют, где текущая версия проваливается;
🟣 после этого система генерирует новую порцию данных ровно под слабые места;
🟣 следующая итерация обучения использует эти данные.
Поверх обычного обучения с учителем идут два слоя обучения с подкреплением.
Первый слой — исправление типовых локальных ошибок. Авторы перечисляют шесть повторяющихся паттернов: агент путает похожие кнопки, ошибается в сортировке, не добирает все нужные элементы, слишком рано объявляет успех, зацикливается на одном действии, плохо использует редкие, но важные действия вроде долгого нажатия или запроса к пользователю.
Под это они собрали отдельные данные и обучили политику штрафовать такие ошибки. Результат — меньше циклов и меньше ложных завершений.
Второй слой — длинные траектории. Здесь агента учат доводить задачу до конца, а не просто красиво делать отдельные шаги. Для этого используют обучение с подкреплением по итоговому результату задачи. Среда запускается параллельно примерно в 10 тысячах экземпляров, чтобы ускорить сбор опыта.
Ключевой эффект такого обучения: агент начинает чаще проверять, что задача реально выполнена. Не «я вроде создал файл, значит всё в порядке», а «я снова открою файл и посмотрю, есть ли там нужный график». Это улучшение поведения, близкое к человеческому.
Что получилось в цифрах
С результатами здесь всё довольно убедительно. Qwen-UI-Agent оказался не узким мобильным агентом, а системой сразу в нескольких режимах.
На мобильных задачах:
🟠 82,1% на MobileWorld
🟠 92,2% на MobileWorld-Real
🟠 97,5% на AndroidDaily
На компьютерных задачах:
🟠 79,5% на OSWorld-Verified
🟠 40,0% по метрике частичного прогресса на OSWorld-v2
На браузерных задачах:
🟠 73,6% на WebArena
На привязке к элементам интерфейса:
🟠 81,5% на ScreenSpot-Pro в режиме с увеличением
Особенно показателен не один рекорд, а разброс. Обычно модели хороши либо в мобильных задачах, либо в браузере, либо в компьютерных сценариях. Здесь видно, что авторы строили базового агента для цифровой среды в целом.
Самая интересная часть: проактивность и работа между устройствами
Поверх модели авторы добавили отдельный слой, который превращает набор действий в помощника.
Пример из статьи: на телефон приходит уведомление об отмене рейса. Вместо того чтобы ждать команду пользователя, система связывает это событие с поездкой, встречами в календаре и личными предпочтениями. Потом ищет альтернативные перелёты и поезда, проверяет, на что вы успеваете, и готовит вариант решения. А уже действия с последствиями — например, перебронирование — просит подтвердить.
Это уже похоже на продуктовую логику помощника. Там есть понятия события, текущего дела, памяти о пользователе и состояния задачи.
Похожая идея работает и для задач между устройствами. Агент может что-то найти на телефоне, продолжить обработку на компьютере, отправить результат и потом вернуть финальный выбор обратно в мобильное приложение. Контекст при этом не теряется.
Для пользователя это важнее, чем ещё плюс 2% на бенчмарке. Большая часть реальной цифровой жизни размазана между приложениями и устройствами. Если агент не умеет переносить состояние между ними, он быстро упирается в потолок пользы.
Где пока есть ограничения
Авторы сами честно показывают ограничения.
🟣 На реальных устройствах успех оценивает не жёсткий программный проверяющий модуль, а автоматический судья по траектории. Он точен, но не идеален.
🟣 Полная автоматизация улучшения агента пока не работает. Люди всё равно следят за пайплайном и вмешиваются.
🟣 Реальные устройства сложно масштабировать. Они дорогие, нестабильные и требуют постоянного обслуживания.
🟣 Даже с пакетными действиями задержка остаётся проблемой. Длинные задачи всё ещё занимают много времени.
Вокруг ИИ-агентов часто много разговоров про универсальность, но меньше — про операционную реальность. А здесь видно, где система упирается в инфраструктуру, а не только в качество модели.
Вывод
Если вы хотите понять, куда движутся ИИ-агенты для интерфейсов, смотреть нужно не только на то, как модель находит кнопку на скриншоте. Смотреть нужно на всю систему.
Qwen-UI-Agent показывает три вещи.
🟠 Реальные устройства важнее красивых симуляций, если вы хотите довести агента до живого применения.
🟠 Гибрид из графического интерфейса, командной строки и API работает лучше, чем ставка на один способ действия.
🟠 Длинные задачи требуют не только рассуждения, но и проверки результата, исправления ошибок, памяти о состоянии и хорошего дата-пайплайна.
В этом направлении ИИ-агенты становятся ближе к полезному цифровому помощнику. К системе, которая умеет последовательно доводить дело до конца на реальных экранах.
ИИ-обзоры простыми словами
Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram