Qwen-UI-Agent 是否能够稳定控制真实手机和桌面端界面?阿里巴巴 Qwen UI Agent 模型系列的 tehnical 报告展示了一种全面的方法,将移动端、电脑、浏览器和深度研究环境统一到一个基础 GUI 智能体中。随着多模态人工智能从对话式提示词向直接执行转变,模型必须跨多个平台以稳定、具有状态感知的方式与图形用户界面(GUI)进行交互。过去,跨操作系统自动化交互通常需要脆弱的自定义脚本或平台专用 API。如今,由于以视觉为中心的系统可以动态解析视觉布局并执行批量命令,工程团队正在评估如何在真实设备环境中构建、测试和部署基础 GUI 智能体。
为什么阿里巴巴 Qwen UI Agent 对真机自动化至关重要
核心概览
- Qwen-UI-Agent 在移动端评测中取得了出色的成果,在 MobileWorld 上得分 82.1%,在 MobileWorld-Real 上得分 92.2%,在 AndroidDaily 上得分 97.5%。
- 该模型将移动端、电脑、浏览器和 DeepSearch 环境统一在一个凝聚力强的以视觉为中心的行动空间中。
- 开发基础设施使用了包含 100 多部智能手机、涵盖 150 多款消费级应用的实时物理移动集群,用于任务创建、训练和测试。
多模态基础模型的演进凸显了一个运营挑战:通用语言模型仍然与直接的操作系统界面相脱节。虽然对话式助手可以处理文本、分析文档并生成代码,但如果没有结构化的 API 集成,它们无法独立浏览第三方原生应用、执行多步骤业务流程或协调复杂的桌面工作流。
为了解决这些界面边界问题,Qwen-UI-Agent 将数字屏幕视为一个统一的操作运行时。通过将视觉定位与顺序决策相结合,该模型能够解释 Android、Windows、macOS 和网页浏览器上的界面布局。系统设计与评估指标记录在官方技术报告中。

Qwen-UI-Agent 的重要性在于其对真机执行的强调。该团队构建了一个包含 100 多部物理智能手机、涵盖 150 多款应用的真机环境,用于任务构建、轨迹收集、训练和评估。为了衡量真实世界的性能,研究人员推出了 MobileWorld-Real 基准测试,其中包含跨 100 多款应用的 400 多个真机任务。该基准测试套件在 MobileWorld 项目文档中有详细说明。团队通过 Qwen-UI-Agent / MAI-UI 官方代码库维护官方项目资料和代码资源,其他演示托管在 Qwen-UI-Agent 官方项目页面上。
GUI、CLI 与批量操作如何协同工作
运营现代电脑和移动端环境需要的不仅仅是映射孤立的指针坐标。在执行多步骤工作流时,智能体必须评估应用状态、适应动态的 UI 渲染变化,并处理高延迟的界面转换。为了扩展运营效率,Qwen-UI-Agent 引入了一个统一的行动空间,将 GUI 指针操作与直接的命令行界面(CLI)执行结合起来。
在台式电脑环境中,CLI 命令和 GUI 点击表现为两种主要的行动类型。该模型可以在单次推理轮次中发出多个行动,其中约 40% 的行动输出被结构化为批量命令。
混合行动流
下图说明了视觉输入如何通过统一的行动空间进行路由:
[屏幕视觉输入]
│
▼
[Qwen-UI-Agent 模型] (直接布局解析与定位)
│
┌─────┴────────────────────────┐
▼ ▼
[GUI 操作] (点击、拖拽) [CLI 操作] (Bash 命令)
└─────┬────────────────────────┘
▼
[批量执行] (每个模型轮次发出多个行动)
通过将 GUI 操作与 CLI 执行交织在一起,智能体能够完成原本需要在单独窗口之间切换的工作流。在跨设备任务中,智能体可以解析来自手机屏幕的视觉元数据,并运行终端命令来组织本地目录或直接操作文件系统。

为什么 100 部真实手机比模拟沙盒更有价值
在合成模拟器中评估多模态 GUI 智能体通常会引入仿真与真实之间的差距(sim-to-real gap)。合成和沙盒环境提供了可扩展且可复现的评估条件,但它们无法完全复现在线设备上遇到的变化中的应用状态、账户条件、网络和交互失败。当部署在物理硬件上时,智能体经常面临不可预测的动画延迟、后台推送通知或波动的蜂窝网络连接。
为了弥合这一差距,开发流程整合了一个包含 100 多部智能手机、运行 150 多款应用的物理移动端测试床。该基础设施在训练和评估期间捕获真实的设备延迟、渲染变化和网络边缘情况。
由此产生的 MobileWorld-Real 基准测试旨在暴露可能被模拟环境隐藏的失败,并在真机条件下评估性能。这种设置凸显了针对真机操作系统行为验证模型价值的重要性。
在线强化学习如何扩展长序列 GUI 任务
执行复杂的跨应用工作流需要对长序列进行持续规划。复杂的任务(例如在移动相册中对账报销收据、在桌面上生成电子表格并将文件同步到远程云存储)通常需要智能体执行超过 100 个步骤的轨迹。在长序列执行中,早期的定位错误可能会导致下游步骤失败。
为了提高轨迹完成度,训练流程利用了可扩展的在线强化学习(RL)。该系统同时在约 10,000 个并行环境中运行 rollout,以加速数据生成。
训练框架整合了一种 AutoResearch 风格的数据飞轮,智能体在此过程中构建任务、生成验证环境、诊断执行错误并规划后续的训练迭代。这一自动化循环减少了人工工程开销,同时迭代扩大了模型的任务解决覆盖范围。
在关键操作中的安全与人工控制
赋予智能体对视觉界面和命令行的直接控制权会引入运营安全风险。与仅限文本的对话式界面不同,与输入字段和系统控制进行交互的 GUI 智能体可能会触发不可逆的操作,例如执行金融交易、修改系统配置或删除文件。
为了管理风险,Qwen-UI-Agent 行动空间包含了一个 ask_user 机制。该设计允许智能体在继续执行敏感或关键操作(如授权付款、授予权限或删除记录)之前暂停执行并请求明确的用户确认。
当智能体检测到敏感工作流时,它会展示其计划的序列并将控制权交还给用户。这种人在回路(human-in-the-loop)机制确保了操作员对关键决策的持续监督。作者指出,开发更系统的安全基准和形式化验证目标仍然是一个持续的研究领域。
开发者在部署 GUI 智能体之前需要了解什么
在实际环境中部署阿里巴巴 Qwen UI Agent 架构需要评估安全边界、执行可靠性和基础设施监控。由于视觉基础模型可以直接与跨应用的图形界面进行交互,而无需专门的每应用 API,开发者必须建立系统级的安全防护措施。
首先,工程团队必须定义权限边界。当授权智能体运行终端命令时,执行必须在沙盒化的、非特权运行时中进行,以防止不受信任的视觉内容在主机系统上触发未经授权的 shell 执行。
其次,团队必须实现具有状态感知的错误恢复。由于真实世界的应用会经历渲染延迟和界面更改,智能体封装层必须监控执行健康状况、检测停滞的工作流并支持回滚机制以维护事务完整性。

跨应用边界管理上下文交接
Qwen-UI-Agent 中演示的多应用工作流也反映了一个更广泛的产品设计挑战:任务上下文越来越需要能够在独立应用和执行环境之间的转换中存续。在智能体运行时中,这种连续性通过交互历史记录以及在预装应用、设备和执行环境之间保留上下文和任务状态的封装层来维护。
当智能体或用户旅程指向尚未安装在设备上的应用时,移动应用分发会引入一个相邻的架构问题。在这些场景中,正常的应用内上下文交接会被应用商店安装边界所打断。诸如 OpoInstall 之类的专业移动端链接架构通过提供延迟深度链接和参数传递能力来解决这一问题,旨在应用首次安装后启动时恢复符合条件的营销活动、目标页面或引荐参数。这两种机制解决了不同生命周期阶段的不同技术问题,但都凸显了在碎片化的应用边界之间保持可靠上下文连续性的日益增长的需求。
常见问题解答 (FAQ)
Qwen-UI-Agent 与其前身 MAI-UI 的核心区别是什么?
智能体如何将 CLI 命令与 GUI 操作结合执行?
Qwen-UI-Agent 能够在没有模拟沙盒的物理设备上运行吗?
工程团队的核心要点
多模态人工智能向基础 GUI 智能体的转变标志着从静态提示词评估向跨操作系统真机执行的转变。随着智能体获得将视觉点击与命令行指令交织在一起的能力,软件架构必须进行调整以支持长序列、自主的交互流。
准备部署 GUI 智能体的工程团队应优先考虑系统级可靠性,而不是单纯的基准测试指标。构建具有弹性的部署需要建立稳健的智能体封装层、定义最小权限边界、实施事务回滚机制,并为关键操作集成人在回路确认(ask_user)。通过围绕环境不稳定性和状态管理进行设计,组织可以部署具备更强运营保障的基础 GUI 智能体。
参考资料
-
Zhou 等人。Qwen-UI-Agent 技术报告:迈向下一代以真实世界为中心的基础 GUI 智能体。https://arxiv.org/abs/2607.28227
-
Kong 等人。MobileWorld:在智能体-用户交互和 MCP 增强环境中对自主移动智能体进行基准测试。https://tongyi-mai.github.io/MobileWorld/
-
Tongyi-MAI 团队。Qwen-UI-Agent / MAI-UI 官方代码库。https://github.com/Tongyi-MAI/MAI-UI
-
MAI-UI 团队。Qwen-UI-Agent 官方项目页面。https://tongyi-mai.github.io/Qwen-UI-Agent/
-
OpoInstall。如何实现带有延迟深度链接和安装归因的引荐跟踪 SDK。https://www.opoinstall.com/blog/referral-tracking-sdk-deferred-deep-linking
Share this article



