阿里 Qwen UI Agent 跨 150 款應用程式實現真實手機操控

opoinstall
2026-08-21
5 min read

Qwen-UI-Agent 能否可靠地控制真實手機與桌面介面?阿里 Qwen UI Agent 模型系列的技術報告展示了一種將行動裝置、電腦、瀏覽器與深度研究環境整合至單一基礎 GUI 代理程式的全面方法。隨著多模態人工智慧從對話式提示詞轉向直接執行,模型必須以可靠且具備狀態感知的方式,在各種平台上與圖形使用者介面 (GUI) 進行互動。過去,自動化作業系統間的互動需要脆弱的自訂腳本或特定平台的 API。如今,由於以視覺為核心的系統能夠動態解析視覺佈局並執行批次指令,工程團隊正在評估如何在真實裝置環境中建構、測試與部署基礎 GUI 代理程式。

為什麼阿里 Qwen UI Agent 對真實裝置自動化至關重要

重點一覽

  • Qwen-UI-Agent 在行動裝置使用評測中取得了頂尖成果,在 MobileWorld 上獲得 82.1%、MobileWorld-Real 獲得 92.2%,以及 AndroidDaily 獲得 97.5% 的分數。
  • 該模型將行動裝置、電腦、瀏覽器與 DeepSearch 環境統一在一個具凝聚力的視覺為核心動作空間中。
  • 開發基礎設施採用包含超過 100 支智慧型手機的實體行動裝置叢集,涵蓋 150 多個消費者應用程式,用於任務建立、訓練與測試。

多模態基礎模型的發展突顯了一個營運挑戰:通用的語言模型仍然與直接的作業系統介面脫節。雖然對話式助理可以處理文字、分析文件並產生程式碼,但若沒有結構化的 API 整合,它們無法獨立瀏覽第三方原生應用程式、執行多步驟物流作業,或協調複雜的桌面工作流程。

為了克服這些介面邊界,Qwen-UI-Agent 將數位螢幕視為一個統一的營運執行環境。透過結合視覺基礎定位與順序決策,該模型能夠解讀 Android、Windows、MacOS 和網頁瀏覽器上的介面佈局。系統設計與評估指標記錄在官方技術報告中。

Qwen-UI-Agent 在八種不同 GUI 評測基準上的效能與比較基準

Qwen-UI-Agent 的重要性在於其對真實裝置執行的重視。該團隊建構了一個包含 100 多支實體智慧型手機、涵蓋 150 多個應用程式的真實裝置環境,用於任務建構、軌跡收集、訓練與評估。為了衡量真實世界的效能,研究人員推出了 MobileWorld-Real 評測基準,其中包含橫跨 100 多個應用程式的 400 多個真實裝置任務。評測基準套件詳見 MobileWorld 專案文件。團隊透過 Qwen-UI-Agent / MAI-UI 官方儲存庫維護官方專案資料與程式碼資源,並在 Qwen-UI-Agent 官方專案頁面上托管了額外的展示。

GUI、CLI 與批次動作如何協同運作

操作現代電腦與行動環境需要的不仅是映射孤立的指標座標。在執行多步驟工作流程時,代理程式必須評估應用程式狀態、考量動態 UI 渲染變化,並處理高延遲的介面轉換。為了擴大營運效率,Qwen-UI-Agent 導入了一個統一的動作空間,結合了 GUI 指標操作與直接的命令列介面 (CLI) 執行。

在桌面電腦環境中,CLI 指令與 GUI 點擊成為兩種主要的動作類型。該模型可以在單一推論回合中發出多個動作,其中約有 40% 的動作輸出被結構化為批次指令。

混合動作流程

下圖說明了視覺輸入如何透過統一的動作空間進行路由:

[Screen Vision Input]
        │
        ▼
[Qwen-UI-Agent Model] (Direct layout parsing & grounding)
        │
  ┌─────┴────────────────────────┐
  ▼                              ▼
[GUI Operations] (Click, Drag)  [CLI Operations] (Bash Commands)
  └─────┬────────────────────────┘
        ▼
[Batched Execution] (Multiple actions emitted per model turn)

透過將 GUI 操作與 CLI 執行交錯進行,代理程式能夠完成原本需要切換不同視窗才能完成的工作流程。在跨裝置任務中,代理程式可以解析來自行動螢幕的視覺中繼資料,並執行終端機指令來組織本機目錄或直接操作檔案系統。

阿里通義千問視覺定位展示執行多步驟搜尋與驗證任務

為什麼 100 支真實手機比模擬沙盒更重要

在合成模擬器中評估多模態 GUI 代理程式通常會引入模擬與現實之間的落差 (sim-to-real gap)。合成與沙盒環境提供了解可擴展且可重複的評估條件,但它們無法完全重現線上裝置上遇到的變化應用程式狀態、帳戶條件、網路與互動失敗。當部署在實體硬體上時,代理程式經常面臨無法預測的動畫延遲、背景推播通知或波動的行動網路連線。

為了縮小此落差,開發管線納入了包含超過 100 支執行 150 多個應用程式的智慧型手機之實體行動測試台。此基礎設施在訓練與評估期間捕捉了真實的裝置延遲、渲染變異與網路邊緣情況。

產生的 MobileWorld-Real 評測基準旨在揭露可能被模擬環境隱藏的失敗,並評估在真實裝置條件下的效能。此設置凸顯了針對真實裝置作業系統行為驗證模型的價值。

線上強化學習如何擴展長視野 GUI 任務

執行複雜的多應用程式工作流程需要跨越長時間序列的持續規劃。複雜的任務——例如在行動相簿中對帳費用收據、在桌面上產生試算表,以及將檔案同步到遠端雲端儲存空間——通常需要代理程式執行超過 100 個步驟的軌跡。在長視野執行中,早期的定位錯誤可能會導致後續步驟失敗。

為了提升軌跡完成率,訓練管線利用了可擴展的線上強化學習 (RL)。系統同時在約 10,000 個平行環境中執行疊代,以加速資料產生。

訓練框架納入了 AutoResearch 風格的資料飛輪,代理程式在此過程中建構任務、產生驗證環境、診斷執行錯誤並規劃後續的訓練疊代。此自動化迴圈減少瞭人工工程開銷,同時疊代擴展了模型的問題解決覆蓋範圍。

重大動作中的安全性與人類控制

賦予代理程式對視覺介面與命令列的直接控制權會帶來營運安全風險。與純文字對話介面不同,與輸入欄位和系統控制項互動的 GUI 代理程式可能會觸發不可逆的操作,例如執行金融交易、修改系統設定或刪除檔案。

為了管理風險,Qwen-UI-Agent 動作空間包含了 ask_user 機制。此設計允許代理程式暫停執行,並在繼續進行敏感或重大動作(例如授權付款、授予權限或刪除記錄)之前請求明確的使用者確認。

當代理程式偵測到敏感的工作流程時,它會呈現其規劃的序列並將控制權交還給使用者。此「人在迴路中 (human-in-the-loop)」機制確保操作員對關鍵決策保持監督。作者指出,開發更具系統性的安全性評測基準與形式化驗證目標仍然是一個持續的研究領域。

開發人員在部署 GUI 代理程式前需要了解的事項

在實際環境中部署阿里 Qwen UI Agent 架構需要評估安全性邊界、執行可靠性與基礎設施監控。由於視覺基礎代理程式直接與應用程式中的圖形介面互動,而不需要專門的各應用程式 API,開發人員必須建立系統層級的防護措施。

首先,工程團隊必須定義權限邊界。當授權代理程式執行終端機指令時,必須在沙盒化的非特權執行環境中進行,以防止不受信任的視覺內容在主機系統上觸發未授權的 Shell 執行。

其次,團隊必須實作具備狀態的錯誤復原。由於真實世界應用程式會經歷渲染延遲與介面變更,代理程式封裝層必須監控執行健康狀況、偵測停滯的工作流程,並支援復原機制以維持交易完整性。

Qwen-UI-Agent 跨多個桌面平台與應用程式執行複雜的多輪任務

管理跨應用程式邊界的情境交接

Qwen-UI-Agent 中展示的多應用程式工作流程也反映了一項更廣泛的產品設計挑戰:任務情境日益需要跨獨立應用程式與執行環境的轉換存活下來。在代理程式執行環境中,這種連續性是透過互動歷史記錄以及在預先安裝的應用程式、裝置和執行環境之間保留情境與任務狀態的封裝層來維持的。

當代理程式或使用者旅程指向尚未安裝在裝置上的應用程式時,行動應用程式分發會引入相鄰的架構問題。在這些情況下,正常的應用程式內情境交接會被應用程式商店安裝邊界所中斷。專門的行動連結架構(例如 OpoInstall)透過提供延遲深度連結與參數傳遞功能來解決此問題,這些功能旨在於應用程式首次安裝後啟動時恢復符合資格的活動、目的地或推薦參數。這兩種機制解決了不同生命週期階段的不同技術問題,但兩者都突顯了在碎片化的應用程式邊界之間對可靠情境連續性的日益增長需求。

常見問題 (FAQ)

Qwen-UI-Agent 與其前身 MAI-UI 的核心區別是什麼?
Qwen-UI-Agent 是 MAI-UI 專案的延續,將早期的 GUI 代理程式工作擴展到涵蓋行動裝置、電腦、瀏覽器與 DeepSearch 環境的更廣泛真實世界基礎代理程式。它新增了統一的 GUI/CLI 動作空間、批次執行、大規模真實裝置基礎設施以及具備狀態的跨平台工作流程。
代理程式如何在執行 GUI 操作的同時執行 CLI 指令?
該模型利用了一個統一的動作空間,將視覺指標點擊與標準終端機指令交錯。在桌面環境中,代理程式可以解析 UI 元素、開啟命令列介面並執行 Shell 指令碼來處理檔案與系統任務,相較於純粹的視覺點擊導航,減少了所需的離散步驟數量。
Qwen-UI-Agent 能在沒有模擬沙盒的實體裝置上運作嗎?
可以。Qwen-UI-Agent 是使用包含超過 100 支連線智慧型手機並執行真實世界消費者應用程式的實體行動裝置叢集進行訓練與評估的。其 92.2% 的 MobileWorld-Real 分數提供了該基準在即時裝置應用程式條件下強大效能的證明。

工程團隊的關鍵要點

多模態 AI 朝著基礎 GUI 代理程式的轉變,標誌著從靜態提示詞評估轉向跨作業系統的真實裝置執行。隨著代理程式獲得將視覺點擊與命令列指令交錯的能力,軟體架構必須適應以支援長視野、自主的互動流程。

準備部署 GUI 代理程式的工程團隊應優先考慮系統層級的可靠性,而非原始的評估基準指標。建構具有彈性的部署需要建立穩健的代理程式封裝層、定義最小權限的權限邊界、實作交易復原機制,並為重大動作整合「人在迴路中」確認機制 (ask_user)。透過圍繞環境不穩定性與狀態管理進行設計,組織可以部署具備更強營運防護措施的基礎 GUI 代理程式。

參考資料

Share this article