क्या Qwen-UI-Agent वास्तविक फोन और डेस्कटॉप इंटरफेस को विश्वसनीयता के साथ नियंत्रित कर सकता है? Alibaba Qwen UI Agent मॉडल परिवार की तकनीकी रिपोर्ट मोबाइल, कंप्यूटर, ब्राउज़र और डीप रिसर्च वातावरण को एक ही फाउंडेशन GUI एजेंट के तहत एकीकृत करने के एक व्यापक दृष्टिकोण को प्रदर्शित करती है। जैसे-जैसे मल्टीमॉडल आर्टिफिशियल इंटेलिजेंस संवादात्मक संकेतों से सीधे निष्पादन की ओर बढ़ रहा है, मॉडल को विभिन्न प्लेटफार्मों पर एक विश्वसनीय और स्टेटफुल तरीके से ग्राफिकल यूजर इंटरफेस (GUIs) के साथ इंटरैक्ट करना चाहिए। ऐतिहासिक रूप से, ऑपरेटिंग सिस्टम में ऑटोमेटेड इंटरैक्शन के लिए नाजुक कस्टम स्क्रिप्ट या प्लेटफ़ॉर्म-विशिष्ट API की आवश्यकता होती थी। आज, क्योंकि विजन-केंद्रित सिस्टम विजुअल लेआउट को गतिशील रूप से पार्स कर सकते हैं और बैच किए गए कमांड निष्पादित कर सकते हैं, इंजीनियरिंग टीमें वास्तविक डिवाइस वातावरण में फाउंडेशन GUI एजेंटों को बनाने, परीक्षण करने और तैनात करने का मूल्यांकन कर रही हैं।
वास्तविक डिवाइस स्वचालन के लिए Alibaba Qwen UI Agent क्यों महत्वपूर्ण है
एक नजर में
- Qwen-UI-Agent मोबाइल-उपयोग मूल्यांकनों पर अत्याधुनिक परिणाम प्राप्त करता है, जो MobileWorld पर 82.1%, MobileWorld-Real पर 92.2% और AndroidDaily पर 97.5% स्कोर करता है।
- यह मॉडल मोबाइल, कंप्यूटर, ब्राउज़र और DeepSearch वातावरण को एक एकजुट विजन-केंद्रित एक्शन स्पेस के तहत एकीकृत करता है।
- विकास बुनियादी ढांचा कार्य निर्माण, प्रशिक्षण और परीक्षण के लिए 150 से अधिक उपभोक्ता अनुप्रयोगों को कवर करने वाले 100 से अधिक स्मार्टफोन्स से मिलकर बने एक लाइव भौतिक मोबाइल क्लस्टर का उपयोग करता है।
मल्टीमॉडल फाउंडेशन मॉडल के विकास ने एक परिचालन चुनौती को उजागर किया है: सामान्य प्रयोजन के भाषा मॉडल सीधे ऑपरेटिंग सिस्टम इंटरफेस से अलग रहते हैं। जबकि संवादात्मक सहायक टेक्स्ट को संसाधित कर सकते हैं, दस्तावेजों का विश्लेषण कर सकते हैं और कोड उत्पन्न कर सकते हैं, वे संरचित API एकीकरण के बिना स्वतंत्र रूप से तीसरे पक्ष के मूल ऐप्स को नेविगेट नहीं कर सकते हैं, बहु-चरणीय लॉजिस्टिक्स निष्पादित नहीं कर सकते हैं, या जटिल डेस्कटॉप वर्कफ़्लो का समन्वय नहीं कर सकते हैं।
इन इंटरफेस सीमाओं को संबोधित करने के लिए, Qwen-UI-Agent डिजिटल स्क्रीन को एक एकीकृत परिचालन रनटाइम के रूप में मानता है। विजुअल ग्राउंडिंग को अनुक्रमिक निर्णय लेने के साथ मिलाकर, मॉडल Android, Windows, macOS और वेब ब्राउज़र में इंटरफेस लेआउट की व्याख्या करता है। सिस्टम डिज़ाइन और मूल्यांकन मेट्रिक्स आधिकारिक तकनीकी रिपोर्ट में प्रलेखित हैं।

Qwen-UI-Agent का महत्व वास्तविक डिवाइस निष्पादन पर इसके जोर में निहित है। टीम ने कार्य निर्माण, प्रक्षेपवक्र संग्रह, प्रशिक्षण और मूल्यांकन के लिए 150 से अधिक अनुप्रयोगों को कवर करने वाले 100 से अधिक भौतिक स्मार्टफ़ोन का एक वास्तविक डिवाइस वातावरण बनाया। वास्तविक दुनिया के प्रदर्शन को मापने के लिए, शोधकर्ताओं ने MobileWorld-Real बेंचमार्क पेश किया, जिसमें 100 से अधिक अनुप्रयोगों में 400 से अधिक वास्तविक डिवाइस कार्य शामिल हैं। बेंचमार्क सूट का विवरण MobileWorld प्रोजेक्ट दस्तावेज़ीकरण में दिया गया है। टीम Qwen-UI-Agent / MAI-UI आधिकारिक रिपॉजिटरी के माध्यम से आधिकारिक प्रोजेक्ट सामग्री और कोड संसाधनों का रखरखाव करती है, और अतिरिक्त डेमो Qwen-UI-Agent आधिकारिक प्रोजेक्ट पेज पर होस्ट किए जाते हैं।
GUI, CLI और बैच किए गए एक्शन एक साथ कैसे काम करते हैं
आधुनिक कंप्यूटर और मोबाइल वातावरण को संचालित करने के लिए अलग-अलग पॉइंटर कोऑर्डिनेट को मैप करने से कहीं अधिक की आवश्यकता होती है। बहु-चरणीय वर्कफ़्लो निष्पादित करते समय, एक एजेंट को एप्लिकेशन स्थितियों का मूल्यांकन करना चाहिए, गतिशील UI रेंडरिंग परिवर्तनों को ध्यान में रखना चाहिए, और उच्च-विलंबता इंटरफेस संक्रमणों को संभालना चाहिए। परिचालन दक्षता का विस्तार करने के लिए, Qwen-UI-Agent एक एकीकृत एक्शन स्पेस पेश करता है जो GUI पॉइंटर संचालन को सीधे कमांड लाइन इंटरफेस (CLI) निष्पादन के साथ जोड़ता है।
डेस्कटॉप कंप्यूटर वातावरण में, CLI कमांड और GUI क्लिक दो प्राथमिक एक्शन प्रकारों के रूप में उभरते हैं। मॉडल एक ही अनुमान टर्न में कई एक्शन उत्सर्जित कर सकता है, जिसमें इसके लगभग 40% एक्शन आउटपुट बैच किए गए कमांड के रूप में संरचित होते हैं।
हाइब्रिड एक्शन फ्लो
नीचे दिया गया आरेख दर्शाता है कि विजुअल इनपुट एकीकृत एक्शन स्पेस के माध्यम से कैसे रूट होते हैं:
[Screen Vision Input]
│
▼
[Qwen-UI-Agent Model] (Direct layout parsing & grounding)
│
┌─────┴────────────────────────┐
▼ ▼
[GUI Operations] (Click, Drag) [CLI Operations] (Bash Commands)
└─────┬────────────────────────┘
▼
[Batched Execution] (Multiple actions emitted per model turn)
GUI संचालन को CLI निष्पादन के साथ अंतरलीव करके, एजेंट उन वर्कफ़्लो को पूरा करता है जिनके लिए अन्यथा अलग-अलग विंडो के बीच स्विच करने की आवश्यकता होती है। क्रॉस-डिवाइस कार्यों में, एजेंट मोबाइल स्क्रीन से विजुअल मेटाडेटा पार्स कर सकता है और स्थानीय निर्देशिकाओं को व्यवस्थित करने या सीधे फ़ाइल सिस्टम में हेरफेर करने के लिए टर्मिनल कमांड चला सकता है.

सिम्युलेटेड सैंडबॉक्स की तुलना में 100 वास्तविक फोन क्यों अधिक मायने रखते हैं
सिंथेटिक एमुलेटर में मल्टीमॉडल GUI एजेंटों का मूल्यांकन करना अक्सर सिम-टू-रियल अंतराल पेश करता है। सिंथेटिक और सैंडबॉक्स वातावरण स्केलेबल और पुनरुत्पादक मूल्यांकन स्थितियां प्रदान करते हैं, लेकिन वे लाइव उपकरणों पर आने वाली बदलती एप्लिकेशन स्थितियों, खाता स्थितियों, नेटवर्क और इंटरैक्शन विफलताओं को पूरी तरह से पुनरुत्पादित नहीं कर सकते हैं। जब भौतिक हार्डवेयर पर तैनात किया जाता है, तो एजेंटों को अक्सर अप्रत्याशित एनिमेशन देरी, पृष्ठभूमि पुश नोटिफिकेशन, या उतार-चढ़ाव वाली सेलुलर कनेक्टिविटी का सामना करना पड़ता है।
इस अंतर को पाटने के लिए, विकास पाइपलाइन में 150 से अधिक अनुप्रयोगों को चलाने वाले 100 से अधिक स्मार्टफ़ोन का एक भौतिक मोबाइल टेस्टबेड शामिल है। यह बुनियादी ढांचा प्रशिक्षण और मूल्यांकन के दौरान वास्तविक डिवाइस विलंबता, रेंडरिंग विविधताओं और नेटवर्क एज केस को कैप्चर करता है।
परिणामी MobileWorld-Real बेंचमार्क उन विफलताओं को उजागर करने के लिए डिज़ाइन किया गया है जो सिम्युलेटेड वातावरण द्वारा छिपाई जा सकती हैं और वास्तविक डिवाइस स्थितियों के तहत प्रदर्शन का मूल्यांकन करती हैं। यह सेटअप वास्तविक डिवाइस ऑपरेटिंग सिस्टम व्यवहार के खिलाफ मॉडल को मान्य करने के मूल्य को रेखांकित करता है।
ऑनलाइन RL लंबे क्षितिज वाले GUI कार्यों को कैसे स्केल करता है
जटिल बहु-ऐप वर्कफ़्लो को निष्पादित करने के लिए विस्तारित अनुक्रमों पर निरंतर योजना की आवश्यकता होती है। जटिल कार्य—जैसे मोबाइल गैलरी में व्यय रसीदों का मिलान करना, डेस्कटॉप पर स्प्रेडशीट तैयार करना, और रिमोट क्लाउड स्टोरेज में फ़ाइलों को सिंक करना—अक्सर एजेंटों को 100 चरणों से अधिक के प्रक्षेपवक्र निष्पादित करने की मांग करते हैं। लंबे क्षितिज वाले निष्पादन में, शुरुआती पोजीशनिंग त्रुटि डाउनस्ट्रीम चरणों को विफल कर सकती है।
प्रक्षेपवक्र पूर्णता में सुधार करने के लिए, प्रशिक्षण पाइपलाइन स्केलेबल ऑनलाइन सुदृढीकरण सीखने (RL) का उपयोग करती है। डेटा जनरेशन को तेज करने के लिए सिस्टम समवर्ती रूप से लगभग 10,000 समानांतर वातावरणों में रोलआउट चलाता है।
प्रशिक्षण फ्रेमवर्क में एक ऑटो-रिसर्च-शैली का डेटा फ़्लाइव्हील शामिल है जहां एजेंट कार्य बनाते हैं, सत्यापन वातावरण उत्पन्न करते हैं, निष्पादन त्रुटियों का निदान करते हैं, और बाद के प्रशिक्षण पुनरावृत्तियों की योजना बनाते हैं। यह स्वचालित लूप मॉडल के समस्या-समाधान कवरेज का iteratively विस्तार करते हुए मैन्युअल इंजीनियरिंग ओवरहेड को कम करता है।
परिणामी कार्रवाइयों में सुरक्षा और मानवीय नियंत्रण
एजेंटों को विजुअल इंटरफेस और कमांड लाइन पर सीधा नियंत्रण देने से परिचालन सुरक्षा जोखिम पैदा होते हैं। केवल टेक्स्ट वाले संवादात्मक इंटरफेस के विपरीत, GUI एजेंट जो इनपुट फ़ील्ड और सिस्टम नियंत्रण के साथ इंटरैक्ट करते हैं, वे अपरिवर्तनीय संचालन को ट्रिगर कर सकते हैं, जैसे वित्तीय लेनदेन निष्पादित करना, सिस्टम कॉन्फ़िगरेशन को संशोधित करना, या फ़ाइलों को हटाना।
जोखिम को प्रबंधित करने के लिए, Qwen-UI-Agent एक्शन स्पेस में एक ask_user तंत्र शामिल है। यह डिज़ाइन एजेंट को निष्पादन को रोकने और संवेदनशील या परिणामी कार्यों (जैसे भुगतान अधिकृत करना, अनुमति देना, या रिकॉर्ड हटाना) के साथ आगे बढ़ने से पहले स्पष्ट उपयोगकर्ता पुष्टिकरण का अनुरोध करने की अनुमति देता है।
जब एजेंट संवेदनशील वर्कफ़्लो का पता लगाता है, तो यह अपने नियोजित अनुक्रम को प्रस्तुत करता है और नियंत्रण वापस उपयोगकर्ता को सौंप देता है। यह मानव-इन-द-लूप तंत्र यह सुनिश्चित करता है कि ऑपरेटर महत्वपूर्ण निर्णयों पर निगरानी बनाए रखे। लेखक नोट करते हैं कि अधिक व्यवस्थित सुरक्षा बेंचमार्क और औपचारिक सत्यापन उद्देश्यों का विकास अनुसंधान का एक निरंतर क्षेत्र बना हुआ है।
GUI एजेंटों को तैनात करने से पहले डेवलपर्स को क्या चाहिए
व्यावहारिक वातावरण में Alibaba Qwen UI Agent आर्किटेक्चर को तैनात करने के लिए सुरक्षा सीमाओं, निष्पादन विश्वसनीयता और बुनियादी ढांचे की निगरानी का मूल्यांकन करना आवश्यक है। चूँकि विजुअल फाउंडेशन एजेंट समर्पित प्रति-ऐप API की आवश्यकता के बिना अनुप्रयोगों में ग्राफिकल इंटरफेस के साथ सीधे इंटरैक्ट करते हैं, डेवलपर्स को सिस्टम-स्तरीय सुरक्षा उपाय स्थापित करने चाहिए।
सबसे पहले, इंजीनियरिंग टीमों को अनुमति सीमाओं को परिभाषित करना चाहिए। जब एजेंटों को टर्मिनल कमांड चलाने के लिए अधिकृत किया जाता है, तो अनसत्यापित विजुअल सामग्री को होस्ट सिस्टम पर अनधिकृत शेल निष्पादन को ट्रिगर करने से रोकने के लिए निष्पादन सैंडबॉक्स किए गए, गैर-विशेषाधिकार प्राप्त रनटाइम में होना चाहिए।
दूसरा, टीमों को स्टेटफुल त्रुटि पुनर्प्राप्ति को लागू करना चाहिए। चूँकि वास्तविक दुनिया के अनुप्रयोगों में रेंडरिंग में देरी और इंटरफेस परिवर्तन का अनुभव होता है, एजेंट हार्नेस परत को निष्पादन स्वास्थ्य की निगरानी करनी चाहिए, रुके हुए वर्कफ़्लो का पता लगाना चाहिए, और लेनदेन अखंडता बनाए रखने के लिए रोलबैक तंत्र का समर्थन करना चाहिए।

एप्लिकेशन सीमाओं में संदर्भ हस्तांतरण का प्रबंधन
Qwen-UI-Agent में प्रदर्शित बहु-अनुप्रयोग वर्कफ़्लो एक व्यापक उत्पाद-डिजाइन चुनौती को भी दर्शाते हैं: कार्य संदर्भ को स्वतंत्र अनुप्रयोगों और निष्पादन वातावरण के बीच संक्रमणों से अधिक से अधिक जीवित रहने की आवश्यकता होती है। एजेंट रनटाइम में, यह निरंतरता इंटरैक्शन इतिहास और हार्નેસ परत के माध्यम से बनाए रखी जाती है जो पूर्व-स्थापित अनुप्रयोगों, उपकरणों और निष्पादन वातावरण में संदर्भ और कार्य स्थिति को संरक्षित करती है।
जब कोई एजेंट या उपयोगकर्ता यात्रा किसी ऐसे एप्लिकेशन की ओर इशारा करती है जो अभी तक डिवाइस पर स्थापित नहीं है, तो मोबाइल ऐप वितरण एक आसन्न वास्तुकीय समस्या पेश करता है। उन परिदृश्यों में, सामान्य इन-ऐप संदर्भ हैंडऑफ़ ऐप स्टोर इंस्टॉलेशन सीमा से बाधित होता है। विशेष मोबाइल लिंकिंग आर्किटेक्चर, जैसे OpoInstall, ऐप के पहले पोस्ट-इंस्टॉल लॉन्च पर योग्य अभियानों, गंतव्य या रेफरल मापदंडों को पुनर्स्थापित करने के लिए डिज़ाइन किए गए डिफ़र्ड डीप लिंकिंग और पैरामीटर पास-थ्रू क्षमताओं प्रदान करके इस समस्या का समाधान करते हैं। दोनों तंत्र विभिन्न जीवनचक्र चरणों में विभिन्न तकनीकी समस्याओं को हल करते हैं, लेकिन दोनों खंडित एप्लिकेशन सीमाओं में विश्वसनीय संदर्भ निरंतरता के लिए बढ़ती आवश्यकता को उजागर करते हैं।
अक्सर पूछे जाने वाले प्रश्न (FAQ)
Qwen-UI-Agent और उसके पूर्ववर्ती MAI-UI के बीच मुख्य अंतर क्या है?
एजेंट GUI संचालन के साथ-साथ CLI कमांड कैसे निष्पादित करता है?
क्या Qwen-UI-Agent सिम्युलेटेड सैंडबॉक्स के बिना भौतिक उपकरणों पर संचालित हो सकता है?
इंजीनियरिंग टीमों के लिए मुख्य बातें
फाउंडेशन GUI एजेंटों की ओर मल्टीमॉडल AI का संक्रमण ऑपरेटिंग सिस्टम में स्थिर संकेत मूल्यांकन से वास्तविक डिवाइस निष्पादन की ओर एक बदलाव को चिह्नित करता है। जैसे-जैसे एजेंटों को कमांड-लाइन निर्देशों के साथ विजुअल क्लिक को अंतरलीव करने की क्षमता मिलती है, सॉफ्टवेयर आर्किटेक्चर को लंबे क्षितिज, स्वायत्त इंटरैक्शन प्रवाह का समर्थन करने के लिए अनुकूल होना चाहिए।
GUI एजेंटों को तैनात करने के लिए तैयार होने वाली इंजीनियरिंग टीमों को कच्चे बेंचमार्क मेट्रिक्स पर सिस्टम-स्तरीय विश्वसनीयता को प्राथमिकता देनी चाहिए। लचीली तैनाती बनाने के लिए मजबूत एजेंट हार्नेस स्थापित करने, कम से कम विशेषाधिकार अनुमति सीमाओं को परिभाषित करने, लेनदेन रोलबैक तंत्र को लागू करने और परिणामी कार्रवाइयों के लिए मानव-इन-द-लूप पुष्टिकरण (ask_user) को एकीकृत करने की आवश्यकता होती है। पर्यावरण की अस्थिरता और राज्य प्रबंधन के आसपास डिजाइन करके, संगठन मजबूत परिचालन सुरक्षा उपायों के साथ फाउंडेशन GUI एजेंटों को तैनात कर सकते हैं।
संदर्भ
-
Zhou et al. Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents. https://arxiv.org/abs/2607.28227
-
Kong et al. MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments. https://tongyi-mai.github.io/MobileWorld/
-
Tongyi-MAI Team. Qwen-UI-Agent / MAI-UI Official Repository. https://github.com/Tongyi-MAI/MAI-UI
-
MAI-UI Team. Qwen-UI-Agent Official Project Page. https://tongyi-mai.github.io/Qwen-UI-Agent/
-
OpoInstall. How to Implement a Referral Tracking SDK with Deferred Deep Linking and Install Attribution. https://www.opoinstall.com/blog/referral-tracking-sdk-deferred-deep-linking
Share this article



