Alibaba Qwen UI Agent 150 से अधिक ऐप्स पर वास्तविक फोन को नियंत्रित करता है

opoinstall
2026-08-21
5 min read

क्या Qwen-UI-Agent वास्तविक फोन और डेस्कटॉप इंटरफेस को विश्वसनीयता के साथ नियंत्रित कर सकता है? Alibaba Qwen UI Agent मॉडल परिवार की तकनीकी रिपोर्ट मोबाइल, कंप्यूटर, ब्राउज़र और डीप रिसर्च वातावरण को एक ही फाउंडेशन GUI एजेंट के तहत एकीकृत करने के एक व्यापक दृष्टिकोण को प्रदर्शित करती है। जैसे-जैसे मल्टीमॉडल आर्टिफिशियल इंटेलिजेंस संवादात्मक संकेतों से सीधे निष्पादन की ओर बढ़ रहा है, मॉडल को विभिन्न प्लेटफार्मों पर एक विश्वसनीय और स्टेटफुल तरीके से ग्राफिकल यूजर इंटरफेस (GUIs) के साथ इंटरैक्ट करना चाहिए। ऐतिहासिक रूप से, ऑपरेटिंग सिस्टम में ऑटोमेटेड इंटरैक्शन के लिए नाजुक कस्टम स्क्रिप्ट या प्लेटफ़ॉर्म-विशिष्ट API की आवश्यकता होती थी। आज, क्योंकि विजन-केंद्रित सिस्टम विजुअल लेआउट को गतिशील रूप से पार्स कर सकते हैं और बैच किए गए कमांड निष्पादित कर सकते हैं, इंजीनियरिंग टीमें वास्तविक डिवाइस वातावरण में फाउंडेशन GUI एजेंटों को बनाने, परीक्षण करने और तैनात करने का मूल्यांकन कर रही हैं।

वास्तविक डिवाइस स्वचालन के लिए Alibaba Qwen UI Agent क्यों महत्वपूर्ण है

एक नजर में

  • Qwen-UI-Agent मोबाइल-उपयोग मूल्यांकनों पर अत्याधुनिक परिणाम प्राप्त करता है, जो MobileWorld पर 82.1%, MobileWorld-Real पर 92.2% और AndroidDaily पर 97.5% स्कोर करता है।
  • यह मॉडल मोबाइल, कंप्यूटर, ब्राउज़र और DeepSearch वातावरण को एक एकजुट विजन-केंद्रित एक्शन स्पेस के तहत एकीकृत करता है।
  • विकास बुनियादी ढांचा कार्य निर्माण, प्रशिक्षण और परीक्षण के लिए 150 से अधिक उपभोक्ता अनुप्रयोगों को कवर करने वाले 100 से अधिक स्मार्टफोन्स से मिलकर बने एक लाइव भौतिक मोबाइल क्लस्टर का उपयोग करता है।

मल्टीमॉडल फाउंडेशन मॉडल के विकास ने एक परिचालन चुनौती को उजागर किया है: सामान्य प्रयोजन के भाषा मॉडल सीधे ऑपरेटिंग सिस्टम इंटरफेस से अलग रहते हैं। जबकि संवादात्मक सहायक टेक्स्ट को संसाधित कर सकते हैं, दस्तावेजों का विश्लेषण कर सकते हैं और कोड उत्पन्न कर सकते हैं, वे संरचित API एकीकरण के बिना स्वतंत्र रूप से तीसरे पक्ष के मूल ऐप्स को नेविगेट नहीं कर सकते हैं, बहु-चरणीय लॉजिस्टिक्स निष्पादित नहीं कर सकते हैं, या जटिल डेस्कटॉप वर्कफ़्लो का समन्वय नहीं कर सकते हैं।

इन इंटरफेस सीमाओं को संबोधित करने के लिए, Qwen-UI-Agent डिजिटल स्क्रीन को एक एकीकृत परिचालन रनटाइम के रूप में मानता है। विजुअल ग्राउंडिंग को अनुक्रमिक निर्णय लेने के साथ मिलाकर, मॉडल Android, Windows, macOS और वेब ब्राउज़र में इंटरफेस लेआउट की व्याख्या करता है। सिस्टम डिज़ाइन और मूल्यांकन मेट्रिक्स आधिकारिक तकनीकी रिपोर्ट में प्रलेखित हैं।

Qwen-UI-Agent आठ अलग-अलग GUI बेंचमार्क और तुलनात्मक बेसलाइन पर प्रदर्शन

Qwen-UI-Agent का महत्व वास्तविक डिवाइस निष्पादन पर इसके जोर में निहित है। टीम ने कार्य निर्माण, प्रक्षेपवक्र संग्रह, प्रशिक्षण और मूल्यांकन के लिए 150 से अधिक अनुप्रयोगों को कवर करने वाले 100 से अधिक भौतिक स्मार्टफ़ोन का एक वास्तविक डिवाइस वातावरण बनाया। वास्तविक दुनिया के प्रदर्शन को मापने के लिए, शोधकर्ताओं ने MobileWorld-Real बेंचमार्क पेश किया, जिसमें 100 से अधिक अनुप्रयोगों में 400 से अधिक वास्तविक डिवाइस कार्य शामिल हैं। बेंचमार्क सूट का विवरण MobileWorld प्रोजेक्ट दस्तावेज़ीकरण में दिया गया है। टीम Qwen-UI-Agent / MAI-UI आधिकारिक रिपॉजिटरी के माध्यम से आधिकारिक प्रोजेक्ट सामग्री और कोड संसाधनों का रखरखाव करती है, और अतिरिक्त डेमो Qwen-UI-Agent आधिकारिक प्रोजेक्ट पेज पर होस्ट किए जाते हैं।

GUI, CLI और बैच किए गए एक्शन एक साथ कैसे काम करते हैं

आधुनिक कंप्यूटर और मोबाइल वातावरण को संचालित करने के लिए अलग-अलग पॉइंटर कोऑर्डिनेट को मैप करने से कहीं अधिक की आवश्यकता होती है। बहु-चरणीय वर्कफ़्लो निष्पादित करते समय, एक एजेंट को एप्लिकेशन स्थितियों का मूल्यांकन करना चाहिए, गतिशील UI रेंडरिंग परिवर्तनों को ध्यान में रखना चाहिए, और उच्च-विलंबता इंटरफेस संक्रमणों को संभालना चाहिए। परिचालन दक्षता का विस्तार करने के लिए, Qwen-UI-Agent एक एकीकृत एक्शन स्पेस पेश करता है जो GUI पॉइंटर संचालन को सीधे कमांड लाइन इंटरफेस (CLI) निष्पादन के साथ जोड़ता है।

डेस्कटॉप कंप्यूटर वातावरण में, CLI कमांड और GUI क्लिक दो प्राथमिक एक्शन प्रकारों के रूप में उभरते हैं। मॉडल एक ही अनुमान टर्न में कई एक्शन उत्सर्जित कर सकता है, जिसमें इसके लगभग 40% एक्शन आउटपुट बैच किए गए कमांड के रूप में संरचित होते हैं।

हाइब्रिड एक्शन फ्लो

नीचे दिया गया आरेख दर्शाता है कि विजुअल इनपुट एकीकृत एक्शन स्पेस के माध्यम से कैसे रूट होते हैं:

[Screen Vision Input]
        │
        ▼
[Qwen-UI-Agent Model] (Direct layout parsing & grounding)
        │
  ┌─────┴────────────────────────┐
  ▼                              ▼
[GUI Operations] (Click, Drag)  [CLI Operations] (Bash Commands)
  └─────┬────────────────────────┘
        ▼
[Batched Execution] (Multiple actions emitted per model turn)

GUI संचालन को CLI निष्पादन के साथ अंतरलीव करके, एजेंट उन वर्कफ़्लो को पूरा करता है जिनके लिए अन्यथा अलग-अलग विंडो के बीच स्विच करने की आवश्यकता होती है। क्रॉस-डिवाइस कार्यों में, एजेंट मोबाइल स्क्रीन से विजुअल मेटाडेटा पार्स कर सकता है और स्थानीय निर्देशिकाओं को व्यवस्थित करने या सीधे फ़ाइल सिस्टम में हेरफेर करने के लिए टर्मिनल कमांड चला सकता है.

Alibaba Tongyi Qianwen विजुअल ग्राउंडिंग डेमो एक बहु-चरणीय खोज और सत्यापन कार्य निष्पादित कर रहा है

सिम्युलेटेड सैंडबॉक्स की तुलना में 100 वास्तविक फोन क्यों अधिक मायने रखते हैं

सिंथेटिक एमुलेटर में मल्टीमॉडल GUI एजेंटों का मूल्यांकन करना अक्सर सिम-टू-रियल अंतराल पेश करता है। सिंथेटिक और सैंडबॉक्स वातावरण स्केलेबल और पुनरुत्पादक मूल्यांकन स्थितियां प्रदान करते हैं, लेकिन वे लाइव उपकरणों पर आने वाली बदलती एप्लिकेशन स्थितियों, खाता स्थितियों, नेटवर्क और इंटरैक्शन विफलताओं को पूरी तरह से पुनरुत्पादित नहीं कर सकते हैं। जब भौतिक हार्डवेयर पर तैनात किया जाता है, तो एजेंटों को अक्सर अप्रत्याशित एनिमेशन देरी, पृष्ठभूमि पुश नोटिफिकेशन, या उतार-चढ़ाव वाली सेलुलर कनेक्टिविटी का सामना करना पड़ता है।

इस अंतर को पाटने के लिए, विकास पाइपलाइन में 150 से अधिक अनुप्रयोगों को चलाने वाले 100 से अधिक स्मार्टफ़ोन का एक भौतिक मोबाइल टेस्टबेड शामिल है। यह बुनियादी ढांचा प्रशिक्षण और मूल्यांकन के दौरान वास्तविक डिवाइस विलंबता, रेंडरिंग विविधताओं और नेटवर्क एज केस को कैप्चर करता है।

परिणामी MobileWorld-Real बेंचमार्क उन विफलताओं को उजागर करने के लिए डिज़ाइन किया गया है जो सिम्युलेटेड वातावरण द्वारा छिपाई जा सकती हैं और वास्तविक डिवाइस स्थितियों के तहत प्रदर्शन का मूल्यांकन करती हैं। यह सेटअप वास्तविक डिवाइस ऑपरेटिंग सिस्टम व्यवहार के खिलाफ मॉडल को मान्य करने के मूल्य को रेखांकित करता है।

ऑनलाइन RL लंबे क्षितिज वाले GUI कार्यों को कैसे स्केल करता है

जटिल बहु-ऐप वर्कफ़्लो को निष्पादित करने के लिए विस्तारित अनुक्रमों पर निरंतर योजना की आवश्यकता होती है। जटिल कार्य—जैसे मोबाइल गैलरी में व्यय रसीदों का मिलान करना, डेस्कटॉप पर स्प्रेडशीट तैयार करना, और रिमोट क्लाउड स्टोरेज में फ़ाइलों को सिंक करना—अक्सर एजेंटों को 100 चरणों से अधिक के प्रक्षेपवक्र निष्पादित करने की मांग करते हैं। लंबे क्षितिज वाले निष्पादन में, शुरुआती पोजीशनिंग त्रुटि डाउनस्ट्रीम चरणों को विफल कर सकती है।

प्रक्षेपवक्र पूर्णता में सुधार करने के लिए, प्रशिक्षण पाइपलाइन स्केलेबल ऑनलाइन सुदृढीकरण सीखने (RL) का उपयोग करती है। डेटा जनरेशन को तेज करने के लिए सिस्टम समवर्ती रूप से लगभग 10,000 समानांतर वातावरणों में रोलआउट चलाता है।

प्रशिक्षण फ्रेमवर्क में एक ऑटो-रिसर्च-शैली का डेटा फ़्लाइव्हील शामिल है जहां एजेंट कार्य बनाते हैं, सत्यापन वातावरण उत्पन्न करते हैं, निष्पादन त्रुटियों का निदान करते हैं, और बाद के प्रशिक्षण पुनरावृत्तियों की योजना बनाते हैं। यह स्वचालित लूप मॉडल के समस्या-समाधान कवरेज का iteratively विस्तार करते हुए मैन्युअल इंजीनियरिंग ओवरहेड को कम करता है।

परिणामी कार्रवाइयों में सुरक्षा और मानवीय नियंत्रण

एजेंटों को विजुअल इंटरफेस और कमांड लाइन पर सीधा नियंत्रण देने से परिचालन सुरक्षा जोखिम पैदा होते हैं। केवल टेक्स्ट वाले संवादात्मक इंटरफेस के विपरीत, GUI एजेंट जो इनपुट फ़ील्ड और सिस्टम नियंत्रण के साथ इंटरैक्ट करते हैं, वे अपरिवर्तनीय संचालन को ट्रिगर कर सकते हैं, जैसे वित्तीय लेनदेन निष्पादित करना, सिस्टम कॉन्फ़िगरेशन को संशोधित करना, या फ़ाइलों को हटाना।

जोखिम को प्रबंधित करने के लिए, Qwen-UI-Agent एक्शन स्पेस में एक ask_user तंत्र शामिल है। यह डिज़ाइन एजेंट को निष्पादन को रोकने और संवेदनशील या परिणामी कार्यों (जैसे भुगतान अधिकृत करना, अनुमति देना, या रिकॉर्ड हटाना) के साथ आगे बढ़ने से पहले स्पष्ट उपयोगकर्ता पुष्टिकरण का अनुरोध करने की अनुमति देता है।

जब एजेंट संवेदनशील वर्कफ़्लो का पता लगाता है, तो यह अपने नियोजित अनुक्रम को प्रस्तुत करता है और नियंत्रण वापस उपयोगकर्ता को सौंप देता है। यह मानव-इन-द-लूप तंत्र यह सुनिश्चित करता है कि ऑपरेटर महत्वपूर्ण निर्णयों पर निगरानी बनाए रखे। लेखक नोट करते हैं कि अधिक व्यवस्थित सुरक्षा बेंचमार्क और औपचारिक सत्यापन उद्देश्यों का विकास अनुसंधान का एक निरंतर क्षेत्र बना हुआ है।

GUI एजेंटों को तैनात करने से पहले डेवलपर्स को क्या चाहिए

व्यावहारिक वातावरण में Alibaba Qwen UI Agent आर्किटेक्चर को तैनात करने के लिए सुरक्षा सीमाओं, निष्पादन विश्वसनीयता और बुनियादी ढांचे की निगरानी का मूल्यांकन करना आवश्यक है। चूँकि विजुअल फाउंडेशन एजेंट समर्पित प्रति-ऐप API की आवश्यकता के बिना अनुप्रयोगों में ग्राफिकल इंटरफेस के साथ सीधे इंटरैक्ट करते हैं, डेवलपर्स को सिस्टम-स्तरीय सुरक्षा उपाय स्थापित करने चाहिए।

सबसे पहले, इंजीनियरिंग टीमों को अनुमति सीमाओं को परिभाषित करना चाहिए। जब एजेंटों को टर्मिनल कमांड चलाने के लिए अधिकृत किया जाता है, तो अनसत्यापित विजुअल सामग्री को होस्ट सिस्टम पर अनधिकृत शेल निष्पादन को ट्रिगर करने से रोकने के लिए निष्पादन सैंडबॉक्स किए गए, गैर-विशेषाधिकार प्राप्त रनटाइम में होना चाहिए।

दूसरा, टीमों को स्टेटफुल त्रुटि पुनर्प्राप्ति को लागू करना चाहिए। चूँकि वास्तविक दुनिया के अनुप्रयोगों में रेंडरिंग में देरी और इंटरफेस परिवर्तन का अनुभव होता है, एजेंट हार्नेस परत को निष्पादन स्वास्थ्य की निगरानी करनी चाहिए, रुके हुए वर्कफ़्लो का पता लगाना चाहिए, और लेनदेन अखंडता बनाए रखने के लिए रोलबैक तंत्र का समर्थन करना चाहिए।

Qwen-UI-Agent कई डेस्कटॉप प्लेटफ़ॉर्म और ऐप्स में एक जटिल बहु-टर्न कार्य निष्पादित कर रहा है

एप्लिकेशन सीमाओं में संदर्भ हस्तांतरण का प्रबंधन

Qwen-UI-Agent में प्रदर्शित बहु-अनुप्रयोग वर्कफ़्लो एक व्यापक उत्पाद-डिजाइन चुनौती को भी दर्शाते हैं: कार्य संदर्भ को स्वतंत्र अनुप्रयोगों और निष्पादन वातावरण के बीच संक्रमणों से अधिक से अधिक जीवित रहने की आवश्यकता होती है। एजेंट रनटाइम में, यह निरंतरता इंटरैक्शन इतिहास और हार्નેસ परत के माध्यम से बनाए रखी जाती है जो पूर्व-स्थापित अनुप्रयोगों, उपकरणों और निष्पादन वातावरण में संदर्भ और कार्य स्थिति को संरक्षित करती है।

जब कोई एजेंट या उपयोगकर्ता यात्रा किसी ऐसे एप्लिकेशन की ओर इशारा करती है जो अभी तक डिवाइस पर स्थापित नहीं है, तो मोबाइल ऐप वितरण एक आसन्न वास्तुकीय समस्या पेश करता है। उन परिदृश्यों में, सामान्य इन-ऐप संदर्भ हैंडऑफ़ ऐप स्टोर इंस्टॉलेशन सीमा से बाधित होता है। विशेष मोबाइल लिंकिंग आर्किटेक्चर, जैसे OpoInstall, ऐप के पहले पोस्ट-इंस्टॉल लॉन्च पर योग्य अभियानों, गंतव्य या रेफरल मापदंडों को पुनर्स्थापित करने के लिए डिज़ाइन किए गए डिफ़र्ड डीप लिंकिंग और पैरामीटर पास-थ्रू क्षमताओं प्रदान करके इस समस्या का समाधान करते हैं। दोनों तंत्र विभिन्न जीवनचक्र चरणों में विभिन्न तकनीकी समस्याओं को हल करते हैं, लेकिन दोनों खंडित एप्लिकेशन सीमाओं में विश्वसनीय संदर्भ निरंतरता के लिए बढ़ती आवश्यकता को उजागर करते हैं।

अक्सर पूछे जाने वाले प्रश्न (FAQ)

Qwen-UI-Agent और उसके पूर्ववर्ती MAI-UI के बीच मुख्य अंतर क्या है?
Qwen-UI-Agent, MAI-UI प्रोजेक्ट का एक विस्तार है, जो मोबाइल, कंप्यूटर, ब्राउज़र और DeepSearch वातावरण में फैले एक व्यापक वास्तविक दुनिया के फाउंडेशन एजेंट की ओर पहले के GUI-एजेंट के काम को आगे बढ़ाता है। यह एक एकीकृत GUI/CLI एक्शन स्पेस, बैच किए गए निष्पादन, बड़े पैमाने पर वास्तविक डिवाइस बुनियादी ढांचे और स्टेटफुल क्रॉस-प्लेटफ़ॉर्म वर्कफ़्लो को जोड़ता है।
एजेंट GUI संचालन के साथ-साथ CLI कमांड कैसे निष्पादित करता है?
मॉडल एक एकीकृत एक्शन स्पेस का उपयोग करता है जो मानक टर्मिनल कमांड के साथ विजुअल पॉइंटर क्लिक को अंतरलीव करता है। डेस्कटॉप वातावरण में, एजेंट फ़ाइल और सिस्टम कार्यों को संभालने के लिए UI तत्वों को पार्स कर सकता है, कमांड-लाइन इंटरफेस खोल सकता है और शेल स्क्रिप्ट चला सकता है, जिससे शुद्ध विजुअल पॉइंट-एंड-क्लिक नेविगेशन की तुलना में आवश्यक अलग-अलग चरणों की संख्या कम हो जाती है।
क्या Qwen-UI-Agent सिम्युलेटेड सैंडबॉक्स के बिना भौतिक उपकरणों पर संचालित हो सकता है?
हाँ। Qwen-UI-Agent को वास्तविक दुनिया के उपभोक्ता अनुप्रयोगों को चलाने वाले 100 से अधिक जुड़े हुए स्मार्टफ़ोन के भौतिक मोबाइल क्लस्टर का उपयोग करके प्रशिक्षित और मूल्यांकित किया गया था। इसका 92.2% MobileWorld-Real स्कोर बेंचमार्क की लाइव-डिवाइस एप्लिकेशन स्थितियों में मजबूत प्रदर्शन का प्रमाण प्रदान करता है।

इंजीनियरिंग टीमों के लिए मुख्य बातें

फाउंडेशन GUI एजेंटों की ओर मल्टीमॉडल AI का संक्रमण ऑपरेटिंग सिस्टम में स्थिर संकेत मूल्यांकन से वास्तविक डिवाइस निष्पादन की ओर एक बदलाव को चिह्नित करता है। जैसे-जैसे एजेंटों को कमांड-लाइन निर्देशों के साथ विजुअल क्लिक को अंतरलीव करने की क्षमता मिलती है, सॉफ्टवेयर आर्किटेक्चर को लंबे क्षितिज, स्वायत्त इंटरैक्शन प्रवाह का समर्थन करने के लिए अनुकूल होना चाहिए।

GUI एजेंटों को तैनात करने के लिए तैयार होने वाली इंजीनियरिंग टीमों को कच्चे बेंचमार्क मेट्रिक्स पर सिस्टम-स्तरीय विश्वसनीयता को प्राथमिकता देनी चाहिए। लचीली तैनाती बनाने के लिए मजबूत एजेंट हार्नेस स्थापित करने, कम से कम विशेषाधिकार अनुमति सीमाओं को परिभाषित करने, लेनदेन रोलबैक तंत्र को लागू करने और परिणामी कार्रवाइयों के लिए मानव-इन-द-लूप पुष्टिकरण (ask_user) को एकीकृत करने की आवश्यकता होती है। पर्यावरण की अस्थिरता और राज्य प्रबंधन के आसपास डिजाइन करके, संगठन मजबूत परिचालन सुरक्षा उपायों के साथ फाउंडेशन GUI एजेंटों को तैनात कर सकते हैं।

संदर्भ

Share this article

Keep Discovering

OpenAI ने Mac पर ChatGPT में Apple Messages नियंत्रण जोड़ा

OpenAI ने Mac पर ChatGPT में Apple Messages नियंत्रण जोड़ा

OpenAI ने Mac पर ChatGPT में Apple Messages समर्थन जोड़ा है। जानिए नई अनुमतियां, डिफ़ॉल्ट संदेश भेजने की स्वीकृतियां और macOS स्वचालन (automation) एजेंट सुरक्षा को कैसे प्रभावित करते हैं।

iOS ऐप्स और SDKs के लिए PrivacyInfo.xcprivacy कैसे लागू करें

iOS ऐप्स और SDKs के लिए PrivacyInfo.xcprivacy कैसे लागू करें

iOS ऐप्स और SDKs के लिए PrivacyInfo.xcprivacy को लागू करना सीखें: आवश्यक कारण API (Required Reason APIs) घोषित करें, गोपनीयता रिपोर्ट (Privacy Reports) जनरेट करें, और CocoaPods साइनिंग त्रुटियों को ठीक करें।

SKAdNetwork S2S वर्कफ़्लो: विज्ञापन नेटवर्क पोस्टबैक को कैसे सत्यापित करें

SKAdNetwork S2S वर्कफ़्लो: विज्ञापन नेटवर्क पोस्टबैक को कैसे सत्यापित करें

जानें कि DSPs और विज्ञापन नेटवर्क Apple SKAdNetwork S2S पोस्टबैक को कैसे सत्यापित करते हैं: U+2063 सिरीलाइज़ेशन, ECDSA P-256 हस्ताक्षर, और ट्रांजैक्शन-आईडी डुप्लीकेशन से बचाव में महारत हासिल करें।