Liệu Qwen-UI-Agent có thể điều khiển điện thoại thực tế và giao diện máy tính một cách đáng tin cậy không? Báo cáo kỹ thuật cho dòng mô hình Alibaba Qwen UI Agent thể hiện một cách tiếp cận toàn diện nhằm hợp nhất môi trường di động, máy tính, trình duyệt và nghiên cứu chuyên sâu dưới một tác nhân GUI nền tảng duy nhất. Khi trí tuệ nhân tạo đa phương thức chuyển từ các câu lệnh trò chuyện sang thực thi trực tiếp, các mô hình phải tương tác với giao diện người dùng đồ họa (GUI) một cách đáng tin cậy, có trạng thái trên nhiều nền tảng đa dạng. Trước đây, việc tự động hóa các tương tác trên hệ điều hành đòi hỏi các tập lệnh tùy chỉnh dễ lỗi hoặc API dành riêng cho từng nền tảng. Ngày nay, nhờ các hệ thống hướng tầm nhìn có thể phân tích cú pháp bố cục trực quan một cách linh hoạt và thực thi các lệnh theo lô, các nhóm kỹ thuật đang đánh giá cách xây dựng, kiểm thử và triển khai các tác nhân GUI nền tảng trong môi trường thiết bị thực.
Tại sao Alibaba Qwen UI Agent quan trọng đối với việc tự động hóa thiết bị thực
Tổng quan nhanh
- Qwen-UI-Agent đạt kết quả tiên tiến nhất trong các đánh giá sử dụng trên di động, ghi nhận 82,1% trên MobileWorld, 92.2% trên MobileWorld-Real và 97,5% trên AndroidDaily.
- Mô hình hợp nhất các môi trường di động, máy tính, trình duyệt và DeepSearch dưới một không gian hành động hướng tầm nhìn thống nhất.
- Hạ tầng phát triển sử dụng cụm thiết bị di động vật lý trực tiếp gồm hơn 100 điện thoại thông minh bao phủ hơn 150 ứng dụng người dùng để tạo tác vụ, huấn luyện và kiểm thử.
Sự tiến hóa của các mô hình nền tảng đa phương thức đã làm nổi bật một thách thức vận hành: các mô hình ngôn ngữ đa năng vẫn tách rời khỏi các giao diện hệ điều hành trực tiếp. Mặc dù các trợ lý trò chuyện có thể xử lý văn bản, phân tích tài liệu và tạo mã, chúng không thể tự lập lịch trình điều hướng các ứng dụng gốc của bên thứ ba, thực thi quy trình hậu cần nhiều bước hoặc phối hợp các quy trình làm việc trên máy tính phức tạp mà không có tích hợp API có cấu trúc.
Để giải quyết các ranh giới giao diện này, Qwen-UI-Agent coi màn hình kỹ thuật số như một thời gian chạy vận hành thống nhất. Bằng cách kết hợp nhận diện thị giác với việc ra quyết định tuần tự, mô hình diễn giải các bố cục giao diện trên Android, Windows, macOS và trình duyệt web. Thiết kế hệ thống và các chỉ số đánh giá được ghi lại trong báo cáo kỹ thuật chính thức.

Tầm quan trọng của Qwen-UI-Agent nằm ở sự chú trọng vào việc thực thi trên thiết bị thực. Nhóm phát triển đã xây dựng một môi trường thiết bị thực gồm hơn 100 điện thoại thông minh vật lý bao phủ hơn 150 ứng dụng để xây dựng tác vụ, thu thập quỹ đạo, huấn luyện và đánh giá. Để đo lường hiệu suất thực tế, các nhà nghiên cứu đã giới thiệu chuẩn đánh giá MobileWorld-Real, bao gồm hơn 400 tác vụ trên thiết bị thực trải dài trên hơn 100 ứng dụng. Bộ chuẩn đánh giá được trình bày chi tiết trong tài liệu dự án MobileWorld. Nhóm duy trì các tài liệu dự án chính thức và tài nguyên mã thông qua Kho lưu trữ chính thức của Qwen-UI-Agent / MAI-UI, với các bản demo bổ sung được lưu trữ trên Trang dự án chính thức của Qwen-UI-Agent.
Cách GUI, CLI và các hành động theo lô kết hợp với nhau
Vận hành môi trường máy tính và di động hiện đại đòi hỏi nhiều hơn việc chỉ ánh xạ các tọa độ con trỏ độc lập. Khi thực thi các quy trình làm việc nhiều bước, một tác nhân phải đánh giá trạng thái ứng dụng, tính đến các thay đổi kết xuất UI động và xử lý việc chuyển đổi giao diện có độ trễ cao. Để mở rộng hiệu quả vận hành, Qwen-UI-Agent giới thiệu một không gian hành động thống nhất kết hợp các thao tác con trỏ GUI với việc thực thi trực tiếp Giao diện dòng lệnh (CLI).
Trong môi trường máy tính để bàn, các lệnh CLI và cú nhấp chuột GUI nổi lên như hai loại hành động chính. Mô hình có thể phát ra nhiều hành động trong một lượt suy luận duy nhất, với khoảng 40% đầu ra hành động được cấu trúc dưới dạng lệnh theo lô.
Luồng hành động kết hợp
Biểu đồ dưới đây minh họa cách các đầu vào trực quan được định tuyến qua không gian hành động thống nhất:
[Screen Vision Input]
│
▼
[Qwen-UI-Agent Model] (Direct layout parsing & grounding)
│
┌─────┴────────────────────────┐
▼ ▼
[GUI Operations] (Click, Drag) [CLI Operations] (Bash Commands)
└─────┬────────────────────────┘
▼
[Batched Execution] (Multiple actions emitted per model turn)
Bằng cách đan xen các thao tác GUI với việc thực thi CLI, tác nhân hoàn thành các quy trình làm việc mà nếu không sẽ phải chuyển đổi giữa các cửa sổ riêng biệt. Trong các tác vụ đa thiết bị, tác nhân có thể phân tích siêu dữ liệu trực quan từ màn hình di động và chạy các lệnh terminal để tổ chức các thư mục cục bộ hoặc thao tác trực tiếp với hệ thống tệp.

Tại sao 100 điện thoại thật quan trọng hơn các môi trường sandbox mô phỏng
Đánh giá các tác nhân GUI đa phương thức trong các trình giả lập tổng hợp thường tạo ra khoảng cách giữa mô phỏng và thực tế (sim-to-real). Các môi trường tổng hợp và sandbox cung cấp các điều kiện đánh giá có thể mở rộng và tái tạo, nhưng chúng không thể tái tạo hoàn toàn các trạng thái ứng dụng đang thay đổi, điều kiện tài khoản, mạng và lỗi tương tác gặp phải trên các thiết bị trực tiếp. Khi được triển khai trên phần cứng vật lý, các tác nhân thường phải đối mặt với độ trễ hoạt ảnh khó đoán, thông báo đẩy nền hoặc kết nối di động dao động.
Để thu hẹp khoảng cách này, quy trình phát triển tích hợp một nền tảng thử nghiệm di động vật lý gồm hơn 100 điện thoại thông minh chạy hơn 150 ứng dụng. Cơ sở hạ tầng này ghi lại độ trễ thiết bị thực tế, các biến thể kết xuất và các trường hợp ngoại lệ về mạng trong quá trình huấn luyện và đánh giá.
Chuẩn đánh giá MobileWorld-Real kết quả được thiết kế để phơi bày các lỗi có thể bị che giấu bởi các môi trường mô phỏng và để đánh giá hiệu suất trong các điều kiện thiết bị thực. Thiết lập này nhấn mạnh giá trị của việc xác thực các mô hình dựa trên hành vi hệ điều hành trên thiết bị thực.
Cách Học tăng cường trực tuyến (Online RL) mở quy mô các tác vụ GUI dài hạn
Việc thực thi các quy trình làm việc đa ứng dụng phức tạp đòi hỏi sự lập kế hoạch bền bỉ qua các chuỗi kéo dài. Các tác vụ phức tạp — chẳng hạn như đối chiếu biên lai chi phí qua các thư viện di động, tạo bảng tính trên máy tính để bàn và đồng bộ hóa tệp lên lưu trữ đám mây từ xa — thường yêu cầu các tác nhân thực thi các quỹ đạo vượt quá 100 bước. Trong quá trình thực thi dài hạn, một lỗi định vị sớm có thể khiến các bước tiếp theo thất bại.
Để cải thiện việc hoàn thành quỹ đạo, quy trình huấn luyện tận dụng học tăng cường (RL) trực tuyến có khả năng mở rộng. Hệ thống chạy các lượt triển khai trên khoảng 10.000 môi trường song song cùng lúc để tăng tốc độ tạo dữ liệu.
Khung huấn luyện tích hợp bánh đà dữ liệu kiểu AutoResearch, nơi các tác nhân xây dựng tác vụ, tạo môi trường xác minh, chẩn đoán lỗi thực thi và lên kế hoạch cho các vòng huấn luyện tiếp theo. Vòng lặp tự động hóa này làm giảm chi phí kỹ thuật thủ công đồng thời mở rộng lặp đi lặp lại phạm vi giải quyết vấn đề của mô hình.
An toàn và sự kiểm soát của con người trong các hành động quan trọng
Việc cấp cho các tác nhân quyền kiểm soát trực tiếp đối với giao diện trực quan và dòng lệnh sẽ làm phát sinh rủi ro bảo mật vận hành. Không giống như các giao diện trò chuyện chỉ có văn bản, các tác nhân GUI tương tác với các trường nhập liệu và điều khiển hệ thống có thể kích hoạt các thao tác không thể hoàn tác, chẳng hạn như thực hiện giao dịch tài chính, sửa đổi cấu hình hệ thống hoặc xóa tệp.
Để quản lý rủi ro, không gian hành động của Qwen-UI-Agent bao gồm cơ chế ask_user. Thiết kế này cho phép tác nhân tạm dừng việc thực thi và yêu cầu xác nhận rõ ràng từ người dùng trước khi tiếp tục với các hành động nhạy cảm hoặc quan trọng, chẳng hạn như ủy quyền thanh toán, cấp quyền hoặc xóa bản ghi.
Khi tác nhân phát hiện các quy trình làm việc nhạy cảm, nó sẽ trình bày trình tự đã lên kế hoạch và trả quyền kiểm soát lại cho người dùng. Cơ chế có sự can thiệp của con người (human-in-the-loop) này đảm bảo rằng người vận hành duy trì quyền giám sát đối với các quyết định quan trọng. Các tác giả lưu ý rằng việc phát triển các chuẩn an toàn có hệ thống hơn và các mục tiêu xác minh hình thức vẫn là một lĩnh vực nghiên cứu đang diễn ra.
Những gì nhà phát triển cần trước khi triển khai tác nhân GUI
Việc triển khai kiến trúc Alibaba Qwen UI Agent trong các môi trường thực tế đòi hỏi việc đánh giá ranh giới bảo mật, độ tin cậy thực thi và giám sát cơ sở hạ tầng. Do các tác nhân nền tảng trực quan tương tác trực tiếp với các giao diện đồ họa trên các ứng dụng mà không cần các API chuyên dụng cho từng ứng dụng, các nhà phát triển phải thiết lập các biện pháp bảo vệ ở cấp độ hệ thống.
Đầu tiên, các nhóm kỹ thuật phải xác định ranh giới quyền hạn. Khi các tác nhân được ủy quyền chạy các lệnh terminal, việc thực thi phải diễn ra trong các môi trường thời gian chạy được đóng hộp (sandbox), không có đặc quyền để ngăn chặn nội dung trực quan không đáng tin cậy kích hoạt việc thực thi shell trái phép trên các hệ thống máy chủ.
Thứ hai, các nhóm phải triển khai khả năng khôi phục lỗi có trạng thái. Do các ứng dụng trong thế giới thực gặp phải độ trễ kết xuất và các thay đổi giao diện, lớp hỗ trợ tác nhân phải theo dõi tình trạng thực thi, phát hiện các quy trình bị đình trệ và hỗ trợ các cơ chế hoàn tác để duy trì tính toàn vẹn của giao dịch.

Quản lý chuyển giao ngữ cảnh qua các ranh giới ứng dụng
Các quy trình làm việc đa ứng dụng được minh họa trong Qwen-UI-Agent cũng phản ánh một thách thức thiết kế sản phẩm rộng lớn hơn: ngữ cảnh tác vụ ngày càng cần phải tồn tại qua các lần chuyển đổi giữa các ứng dụng và môi trường thực thi độc lập. Trong các môi trường thời gian chạy của tác nhân, tính liên tục này được duy trì thông qua lịch sử tương tác và lớp hỗ trợ giúp bảo lưu ngữ cảnh và trạng thái tác vụ trên các ứng dụng, thiết bị và môi trường thực thi được cài đặt sẵn.
Việc phân phối ứng dụng di động giới thiệu một vấn đề kiến trúc liền kề khi một hành trình của tác nhân hoặc người dùng hướng tới một ứng dụng chưa được cài đặt trên thiết bị. Trong các kịch bản đó, quá trình chuyển giao ngữ cảnh trong ứng dụng thông thường bị gián đoạn bởi ranh giới cài đặt của cửa hàng ứng dụng. Các kiến trúc liên kết di động chuyên biệt, chẳng hạn như OpoInstall, giải quyết vấn đề này bằng cách cung cấp các tính năng liên kết sâu hoãn lại (deferred deep linking) và chuyển tiếp tham số được thiết kế để khôi phục các tham số chiến dịch, điểm đến hoặc giới thiệu đủ điều kiện ngay trong lần khởi chạy đầu tiên sau khi cài đặt ứng dụng. Hai cơ chế giải quyết các vấn đề kỹ thuật khác nhau ở các giai đoạn vòng đời khác nhau, nhưng cả hai đều làm nổi bật nhu cầu ngày càng tăng về tính liên tục của ngữ cảnh đáng tin cậy trên các ranh giới ứng dụng bị phân mảnh.
Các câu hỏi thường gặp (FAQ)
Sự khác biệt cốt lõi giữa Qwen-UI-Agent và người tiền nhiệm MAI-UI là gì?
Tác nhân thực thi các lệnh CLI song song với các thao tác GUI như thế nào?
Qwen-UI-Agent có thể hoạt động trên các thiết bị vật lý mà không cần các sandbox mô phỏng không?
Những điểm chính dành cho các nhóm kỹ thuật
Sự chuyển dịch của AI đa phương thức hướng tới các tác nhân GUI nền tảng đánh dấu một sự chuyển đổi từ đánh giá câu lệnh tĩnh sang thực thi trên thiết bị thực qua các hệ điều hành. Khi các tác nhân có được khả năng đan xen các cú nhấp chuột trực quan với các hướng dẫn dòng lệnh, các kiến trúc phần mềm phải thích ứng để hỗ trợ các luồng tương tác tự động, dài hạn.
Các nhóm kỹ thuật chuẩn bị triển khai các tác nhân GUI nên ưu tiên độ tin cậy ở cấp độ hệ thống hơn các chỉ số chuẩn thô. Việc xây dựng các bản triển khai có khả năng phục hồi đòi hỏi việc thiết lập các lớp hỗ trợ tác nhân vững chắc, xác định các ranh giới quyền hạn tối thiểu, triển khai các cơ chế hoàn tác giao dịch và tích hợp xác nhận có sự can thiệp của con người (ask_user) cho các hành động quan trọng. Bằng cách thiết kế xoay quanh sự bất ổn định của môi trường và quản lý trạng thái, các tổ chức có thể triển khai các tác nhân GUI nền tảng với các biện pháp bảo vệ vận hành mạnh mẽ hơn.
Tài liệu tham khảo
-
Zhou et al. Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents. https://arxiv.org/abs/2607.28227
-
Kong et al. MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments. https://tongyi-mai.github.io/MobileWorld/
-
Tongyi-MAI Team. Qwen-UI-Agent / MAI-UI Official Repository. https://github.com/Tongyi-MAI/MAI-UI
-
MAI-UI Team. Qwen-UI-Agent Official Project Page. https://tongyi-mai.github.io/Qwen-UI-Agent/
-
OpoInstall. How to Implement a Referral Tracking SDK with Deferred Deep Linking and Install Attribution. https://www.opoinstall.com/blog/referral-tracking-sdk-deferred-deep-linking
Share this article



