Агент Alibaba Qwen UI управляет реальными смартфонами в 150 приложениях

opoinstall
2026-08-21
5 min read

Способен ли Qwen-UI-Agent надежно управлять реальными телефонами и интерфейсами десктопов? В техническом отчете о семействе моделей Alibaba Qwen UI Agent представлен комплексный подход к объединению мобильных, компьютерных, браузерных сред и систем глубоких исследований в рамках единого базового GUI-агента. По мере того как мультимодальный искусственный интеллект переходит от текстовых запросов к прямому выполнению задач, моделям необходимо взаимодействовать с графическими интерфейсами (GUI) надежным и учитывающим состояние образом на самых разных платформах. Исторически сложилось так, что автоматизация взаимодействия между операционными системами требовала хрупких пользовательских скриптов или специализированных под конкретные платформы API. Сегодня, поскольку системы на базе компьютерного зрения способны динамически распознавать визуальные макеты и выполнять пакетные команды, инженерные команды изучают возможности создания, тестирования и развертывания базовых GUI-агентов в условиях работы с реальными устройствами.

Почему агент Alibaba Qwen UI важен для автоматизации на реальных устройствах

Краткий обзор

  • Qwen-UI-Agent демонстрирует передовые результаты в мобильных тестах, набирая 82.1% в MobileWorld, 92.2% в MobileWorld-Real и 97.5% в AndroidDaily.
  • Модель объединяет мобильные, компьютерные, браузерные среды и среду DeepSearch в рамках единого пространства действий на основе компьютерного зрения.
  • Инфраструктура разработки использует действующий кластер физических мобильных устройств, состоящий из более чем 100 смартфонов и охватывающий свыше 150 потребительских приложений для создания задач, обучения и тестирования.

Эволюция мультимодальных базовых моделей выявила одну операционную сложность: универсальные языковые модели остаются изолированными от прямых интерфейсов операционных систем. Хотя разговорные ассистенты могут обрабатывать текст, анализировать документы и генерировать код, они не способны самостоятельно навигировать в сторонних нативных приложениях, выполнять многоэтапные логистические операции или координировать сложные десктопные рабочие процессы без интеграции структурированных API.

Для преодоления этих ограничений интерфейса Qwen-UI-Agent рассматривает цифровые экраны как единую операционную среду выполнения. Сочетая визуальное позиционирование с последовательным принятием решений, модель интерпретирует макеты интерфейсов на Android, Windows, macOS и в веб-браузерах. Архитектура системы и метрики оценки задокументированы в официальном техническом отчете.

Производительность Qwen-UI-Agent в восьми различных GUI-бенчмарках и сравнение с базовыми моделями

Значение Qwen-UI-Agent заключается в акценте на выполнение задач на реальных устройствах. Команда создала среду из более чем 100 физических смартфонов, охватывающую более 150 приложений для создания задач, сбора траекторий, обучения и оценки. Для измерения эффективности в реальных условиях исследователи представили бенчмарк MobileWorld-Real, который содержит более 400 задач для реальных устройств в более чем 100 приложениях. Набор бенчмарков подробно описан в документации проекта MobileWorld. Команда поддерживает официальные материалы проекта и ресурсы кода через официальный репозиторий Qwen-UI-Agent / MAI-UI, а дополнительные демоверсии размещены на официальной странице проекта Qwen-UI-Agent.

Как графический интерфейс (GUI), интерфейс командной строки (CLI) и пакетные действия работают вместе

Работа в современных компьютерных и мобильных средах требует большего, чем просто сопоставление изолированных координат указателя. При выполнении многоэтапных рабочих процессов агент должен оценивать состояния приложений, учитывать динамические изменения рендеринга пользовательского интерфейса и справляться с задержками при переключении интерфейсов. Для повышения операционной эффективности Qwen-UI-Agent вводит единое пространство действий, которое объединяет операции с графическим указателем и прямое выполнение команд через интерфейс командной строки (CLI).

В средах настольных компьютеров команды CLI и клики в графическом интерфейсе выступают в качестве двух основных типов действий. Модель может выдавать несколько действий за один шаг инференса, причем примерно 40% ее выходных данных структурированы в виде пакетных команд.

Гибридный поток действий

На диаграмме ниже показано, как визуальные входные данные маршрутизируются через единое пространство действий:

[Screen Vision Input]
        │
        ▼
[Qwen-UI-Agent Model] (Direct layout parsing & grounding)
        │
  ┌─────┴────────────────────────┐
  ▼                              ▼
[GUI Operations] (Click, Drag)  [CLI Operations] (Bash Commands)
  └─────┬────────────────────────┘
        ▼
[Batched Execution] (Multiple actions emitted per model turn)

Чередуя операции в графическом интерфейсе с выполнением команд CLI, агент завершает рабочие процессы, для которых в противном случае потребовалось бы переключение между отдельными окнами. При выполнении межплатформенных задач агент может анализировать визуальные метаданные с экрана мобильного телефона и запускать команды терминала для упорядочивания локальных каталогов или непосредственного управления файловой системой.

Демонстрация визуального позиционирования Alibaba Tongyi Qianwen при выполнении многоэтапной задачи поиска и верификации

Почему 100 реальных телефонов важнее смоделированных песочниц

Оценка мультимодальных GUI-агентов в синтетических эмуляторах часто сталкивается с разрывом между симуляцией и реальностью (sim-to-real gap). Синтетические среды и песочницы обеспечивают масштабируемые и воспроизводимые условия оценки, но они не могут полностью воссоздать изменяющиеся состояния приложений, параметры учетных записей, особенности сетей и сбои взаимодействия, возникающие на реальных устройствах. При развертывании на физическом оборудовании агенты часто сталкиваются с непредсказуемыми задержками анимации, фоновыми пуш-уведомлениями или нестабильным подключением к сотовой сети.

Чтобы преодолеть этот разрыв, пайплайн разработки включает в себя физический тестовый стенд из более чем 100 смартфонов, на которых запущено более 150 приложений. Эта инфраструктура фиксирует реальные задержки устройств, вариации рендеринга и краевые сетевые случаи в процессе обучения и оценки.

Полученный в результате бенчмарк MobileWorld-Real разработан для выявления сбоев, которые могут быть скрыты в смоделированных средах, и оценки производительности в условиях реальных устройств. Такой подход подчеркивает ценность проверки моделей на соответствие поведению операционной системы реальных устройств.

Как онлайн-обучение с подкреплением масштабирует долгосрочные GUI-задачи

Выполнение сложных рабочих процессов, охватывающих множество приложений, требует непрерывного планирования на протяженных последовательностях. Сложные задачи — такие как сверка чеков расходов по галерее мобильного устройства, создание электронных таблиц на десктопе и синхронизация файлов с удаленным облачным хранилищем — часто требуют от агентов выполнения траекторий, превышающих 100 шагов. При долгосрочном выполнении ранняя ошибка позиционирования может привести к сбою последующих шагов.

Для улучшения завершения траекторий в обучающем пайплайне используется масштабируемое онлайн-обучение с подкреплением (RL). Система выполняет запуски примерно в 10 000 параллельных сред одновременно для ускорения генерации данных.

Обучающий фреймворк включает в себя маховик данных в стиле AutoResearch, в рамках которого агенты создают задачи, генерируют среды верификации, диагностируют ошибки выполнения и планируют последующие итерации обучения. Этот автоматизированный цикл снижает объем ручной инженерной работы и при этом итеративно расширяет покрытие решаемых моделью задач.

Безопасность и контроль человека при выполнении ответственных действий

Предоставление агентам прямого контроля над визуальными интерфейсами и командной строкой создает риски операционной безопасности. В отличие от текстовых диалоговых интерфейсов, GUI-агенты, взаимодействующие с полями ввода и системными элементами управления, могут инициировать необратимые операции, такие как проведение финансовых транзакций, изменение конфигурации системы или удаление файлов.

Для управления рисками пространство действий Qwen-UI-Agent включает механизм ask_user. Эта архитектура позволяет агенту приостанавливать выполнение и запрашивать явное подтверждение пользователя перед переходом к чувствительным или ответственным действиям, таким как авторизация платежей, предоставление разрешений или удаление записей.

Когда агент обнаруживает чувствительные рабочие процессы, он демонстрирует свою запланированную последовательность действий и возвращает управление пользователю. Этот механизм участия человека в контуре управления (human-in-the-loop) гарантирует, что оператор сохраняет контроль над критическими решениями. Авторы отмечают, что разработка более систематических бенчмарков безопасности и целей формальной верификации остается постоянной областью исследований.

Что нужно разработчикам перед развертыванием GUI-агентов

Развертывание архитектуры агента Alibaba Qwen UI в практических средах требует оценки границ безопасности, надежности выполнения и мониторинга инфраструктуры. Поскольку визуальные базовые агенты взаимодействуют непосредственно с графическими интерфейсами различных приложений без необходимости использования специализированных API для каждого приложения, разработчики должны установить системные средства защиты.

Во-первых, инженерные команды должны определить границы разрешений. Когда агентам разрешено выполнять команды терминала, выполнение должно происходить в изолированных средах (песочницах) с ограниченными привилегиями, чтобы предотвратить запуск несанкционированного кода в командной оболочке хост-системы ненадежным визуальным контентом.

Во-вторых, команды должны реализовать восстановление после сбоев с учетом состояния. Поскольку в реальных приложениях возникают задержки рендеринга и изменения интерфейса, уровень поддержки агента должен контролировать работоспособность выполнения, обнаруживать зависшие рабочие процессы и поддерживать механизмы отката для сохранения целостности транзакций.

Qwen-UI-Agent выполняет сложную многошаговую задачу в различных десктопных платформах и приложениях

Управление передачей контекста между границами приложений

Многоприложные рабочие процессы, продемонстрированные в Qwen-UI-Agent, также отражают более широкую проблему продуктового дизайна: контекст задачи все чаще должен сохраняться при переходе между независимыми приложениями и средами выполнения. В средах выполнения агентов эта непрерывность поддерживается за счет истории взаимодействия и уровня обвязки (harness layer), который сохраняет контекст и состояние задачи в предварительно установленных приложениях, на устройствах и в средах выполнения.

Дистрибуция мобильных приложений порождает смежную архитектурную проблему, когда путь агента или пользователя ведет к приложению, которое еще не установлено на устройстве. В таких сценариях нормальная передача контекста внутри приложения прерывается границей установки из магазина приложений. Специализированные мобильные линкинг-архитектуры, такие как OpoInstall, решают эту задачу, предоставляя возможности отложенного диплинкинга (deferred deep linking) и передачи параметров, предназначенные для восстановления актуальных параметров кампании, целевой страницы или реферальных данных при первом запуске приложения после установки. Эти два механизма решают разные технические проблемы на разных этапах жизненного цикла, но оба подчеркивают растущую потребность в надежной непрерывности контекста через фрагментированные границы приложений.

Часто задаваемые вопросы (FAQ)

В чем основное отличие между Qwen-UI-Agent и его предшественником MAI-UI?
Qwen-UI-Agent является продолжением проекта MAI-UI, расширяя предыдущие наработки по GUI-агентам до масштабов более универсального базового агента реального мира, охватывающего мобильные, компьютерные, браузерные среды и среду DeepSearch. Он добавляет унифицированное пространство действий GUI/CLI, пакетное выполнение, крупномасштабную инфраструктуру реальных устройств и межплатформенные рабочие процессы с отслеживанием состояния.
Как агент выполняет команды CLI наряду с операциями GUI?
Модель использует единое пространство действий, которое чередует визуальные клики указателя со стандартными командами терминала. В средах настольных компьютеров агент может разбирать элементы интерфейса, открывать интерфейс командной строки и запускать скрипты оболочки для работы с файлами и системой, сокращая количество дискретных шагов по сравнению с чистой визуальной навигацией методом указания и клика.
Может ли Qwen-UI-Agent работать на физических устройствах без смоделированных песочниц?
Да. Qwen-UI-Agent обучался и оценивался с использованием кластера физических мобильных устройств, состоящего из более чем 100 подключенных смартфонов с реальными потребительскими приложениями. Его результат 92.2% в бенчмарке MobileWorld-Real подтверждает высокую производительность в условиях реальных приложений на живых устройствах.

Основные выводы для инженерных команд

Переход мультимодального ИИ к базовым GUI-агентам знаменует собой сдвиг от оценки статических промптов к выполнению задач на реальных устройствах в различных операционных системах. По мере того как агенты приобретают способность совмещать визуальные клики с инструкциями командной строки, программные архитектуры должны адаптироваться для поддержки долгосрочных автономных сценариев взаимодействия.

Инженерные команды, готовящиеся к развертыванию GUI-агентов, должны ставить надежность на уровне системы выше «сырых» метрик бенчмарков. Создание отказоустойчивых развертываний требует создания надежных механизмов обвязки агентов (harnesses), определения границ прав доступа по принципу наименьших привилегий, внедрения механизмов отката транзакций и интеграции подтверждения с участием человека (ask_user) для ответственных действий. Проектируя системы с учетом нестабильности среды и управления состояниями, организации могут развертывать базовые GUI-агенты с более высоким уровнем операционной защиты.

Ссылки

Share this article