هل يستطيع وكيل واجهة مستخدم Qwen التحكم بشكل موثوق في الهواتف الحقيقية واجهات سطح المكتب؟ يوضح التقرير التقني لعائلة نموذج وكيل واجهة المستخدم Qwen من علي بابا نهجاً شاملاً لتوحيد بيئات الهواتف المحمولة، وأجهزة الكمبيوتر، والمتصفحات، والبحث العميق تحت وكيل واجهة مستخدم أساسي واحد. مع انتقال الذكاء الاصطناعي متعدد الوسائط من المطالبات المحادثية إلى التنفيذ المباشر، يجب على النموذج التفاعل مع واجهات المستخدم الرسومية (GUIs) بطريقة موثوقة ومحتفظة بالحالة عبر منصات متنوعة. تاريخياً، تطلبت أتمتة التفاعلات عبر أنظمة التشغيل نصوصاً برمجية مخصصة هشة أو واجهات برمجة تطبيقات خاصة بالمنصة. والיום، نظراً لأن الأنظمة المرتكزة على الرؤية يمكنها تحليل التخطيطات المرئية ديناميكياً وتنفيذ أوامر مجمعة، فإن الفرق الهندسية تقيم كيفية بناء واختبار ونشر وكلاء واجهة المستخدم الأساسيين في بيئات الأجهزة الحقيقية.
لماذا يعتبر وكيل واجهة مستخدم Qwen من علي بابا مهمّاً لأتمتة الأجهزة الحقيقية
لمحة سريعة
- يحقق Qwen-UI-Agent نتائج متطورة في تقييمات الاستخدام على الهاتف المحمول، مسجلاً 82.1% على MobileWorld، و92.2% على MobileWorld-Real، و97.5% على AndroidDaily.
- يوحد النموذج بيئات الهواتف المحمولة، وأجهزة الكمبيوتر، والمتصفحات، والبحث العميق (DeepSearch) تحت مساحة عمل مرئية موحدة.
- تستخدم البنية التحتية للتطوير مجموعة هواتف محمولة مادية حية تتكون من أكثر من 100 هاتف ذكي تغطي أكثر من 150 تطبيقاً للمستهلكين لإنشاء المهام، والتدريب، والاختبار.
لقد سلط تطور نماذج الأساس متعددة الوسائط الضوء على تحدٍ تشغيلي: تظل نماذج اللغات ذات الأغراض العامة بمعزل عن واجهات أنظمة التشغيل المباشرة. وفي حين تستطيع المساعدات المحادثية معالجة النصوص، وتحليل المستندات، وتوليد التعليمات البرمجية، إلا أنها لا تستطيع التنقل بشكل مستقل في تطبيقات الطرف الثالث الأصلية، أو تنفيذ عمليات لوجستية متعددة الخطوات، أو تنسيق سير عمل سطح المكتب المعقد دون تكاملات هيكلية لواجهات برمجة التطبيقات.
ولمعالجة حدود واجهات التفاعل هذه، يعامل Qwen-UI-Agent الشاشات الرقمية كوحدة تشغيل موحدة. ومن خلال الجمع بين المعالجة البصرية واتخاذ القرار المتسلسل، يفسر النموذج تخطيطات واجهة المستخدم عبر أنظمة Android وWindows وmacOS ومتصفحات الويب. تم توثيق تصميم النظام ومقاييس التقييم في التقرير التقني الرسمي.

تكمن أهمية وكيل واجهة مستخدم Qwen في تركيزه على التنفيذ على الأجهزة الحقيقية. فقد بنى الفريق بيئة أجهزة حقيقية تضم أكثر من 100 هاتف محمول مادي تغطي أكثر من 150 تطبيقاً لبناء المهام، وجمع مسارات الحركة، والتدريب، والتقييم. ولقیاس الأداء في العالم الحقيقي، قدم الباحثون مقياس MobileWorld-Real، الذي يحتوي على أكثر من 400 مهمة على أجهزة حقيقية عبر أكثر من 100 تطبيق. يتم تفصيل مجموعة المقاييس في وثائق مشروع MobileWorld. ويحافظ الفريق على مواد المشروع الرسمية وموارد التعليمات البرمجية عبر مستودع المستودع الرسمي لوكيل واجهة مستخدم Qwen / MAI-UI، مع استضافة عروض توضيحية إضافية على صفحة المشروع الرسمية لوكيل واجهة مستخدم Qwen.
كيف تعمل واجهة المستخدم الرسومية، وواجهة سطر الأوامر (CLI)، والأوامر المجمعة معاً
يتطلب تشغيل بيئات الكمبيوتر والهواتف المحمولة الحديثة أكثر من مجرد تعيين إحداثيات مؤشر معزولة. عند تنفيذ سير عمل متعدد الخطوات، يجب على الوكيل تقييم حالات التطبيق، ومراعاة تغييرات عرض واجهة المستخدم الديناميكية، والتعامل مع انتقالات واجهة عالية زمن الانتقال. ولتوسيع الكفاءة التشغيلية، يقدم Qwen-UI-Agent مساحة عمل موحدة تدمج عمليات المؤشر الرسومي مع التنفيذ المباشر لواجهة سطر الأوامر (CLI).
في بيئات أجهزة الكمبيوتر المكتبية، تبرز أوامر واجهة سطر الأوامر ونقرات واجهة المستخدم الرسومية كنوعين أساسيين للإجراءات. يمكن للنموذج إصدار إجراءات متعددة في دورة استدلال واحدة، حيث يتم هيكلة ما يقرب من 40% من مخرجات إجراءاته كأوامر مجمعة.
تدفق الإجراءات الهجينة
يوضح الرسم البياني أدناه كيف يتم توجيه المدخلات المرئية عبر مساحة العمل الموحدة:
[Screen Vision Input]
│
▼
[Qwen-UI-Agent Model] (Direct layout parsing & grounding)
│
┌─────┴────────────────────────┐
▼ ▼
[GUI Operations] (Click, Drag) [CLI Operations] (Bash Commands)
└─────┬────────────────────────┘
▼
[Batched Execution] (Multiple actions emitted per model turn)
من خلال تداخل عمليات واجهة المستخدم الرسومية مع تنفيذ واجهة سطر الأوامر، يكمل الوكيل مهام سير العمل التي تتطلب لولا ذلك التبديل بين نوافذ منفصلة. وفي المهام عبر الأجهزة، يمكن للوكيل تحليل البيانات الوصفية المرئية من شاشة الهاتف المحمول وتشغيل أوامر المحطة الطرفية لتنظيم المجلدات المحلية أو معالجة أنظمة الملفات مباشرة.

لماذا تمثل 100 هاتف حقيقي أهمية أكبر من بيئات الاختبار الوهمية المحاكية
غالباً ما يواجه تقييم وكلاء واجهة المستخدم الرسومية متعددة الوسائط في المحاكيات الاصطناعية فجوة بين المحاكاة والواقع. توفر البيئات الاصطناعية وبيئات الحماية شروط تقييم قابلة للتوسع والتكرار، لكنها لا تستطيع إعادة إنتاج حالات التطبيق المتغيرة، وحالات الحساب، والشبكات، وفشلات التفاعل التي تمت مواجهتها على الأجهزة الحية بشكل كامل. عند نشرها على الأجهزة الفيزيائية، يواجه الوكلاء غالباً تأخيرات غير متوقعة في الرسوم المتحركة، أو إشعارات دفع في الخلفية، أو تقلبات في اتصال الشبكة الخلوية.
لسد هذه الفجوة، يدمج مسار التطوير بيئة اختبار محمولة فعلية تضم أكثر من 100 هاتف ذكي تشغل أكثر من 150 تطبيقاً. تلتقط هذه البنية التحتية زمن انتقال الأجهزة الحقيقي، واختلافات العرض، وحالات الحافة للشبكة أثناء التدريب والتقييم.
تم تصميم مقياس MobileWorld-Real الناتج لكشف حالات الفشل التي قد توارت خلف البيئات المحاكية ولتقييم الأداء في ظل ظروف الأجهزة الحقيقية. يؤكد هذا الإعداد على قيمة التحقق من صحة النماذج في مواجهة سلوك نظام التشغيل على الأجهزة الحقيقية.
كيف يقوم التعلم الإلزامي عبر الإنترنت بتوسيع نطاق مهام واجهة المستخدم الرسومية طويلة المدى
يتطلب تنفيذ سير عمل معقد ومتعدد التطبيقات تخطيطاً مستمراً عبر تسلسلات ممتدة. غالباً ما تتطلب المهام المعقدة - مثل تسوية إيصالات المصروفات عبر معرض الهاتف المحمول، وإنشاء جداول بيانات على سطح المكتب، ومزامنة الملفات التخزين السحابي البعيد - من الوكلاء تنفيذ مسارات تتجاوز 100 خطوة. في التنفيذ طويل المدى، يمكن أن يتسبب خطأ تمركز مبكر في فشل الخطوات اللاحقة.
لتحسين اكتمال المسار، يستخدم مسار التدريب التعلم المعزز عبر الإنترنت القابل للتوسع (RL). يقوم النظام بتشغيل جولات عبر ما يقرب من 10,000 بيئة متوازية في وقت واحد تسريع وتيرة توليد البيانات.
يشتمل إطار التدريب على عجلة بيانات بأسلوب AutoResearch حيث يقوم الوكلاء ببناء المهام، وإنشاء بيئات التحقق، وتشخيص أخطاء التنفيذ، وتخطيط تكرارات التدريب اللاحقة. تقلل هذه الحلقة الآلية من العبء الهندسي اليدوي بينما توسع نطاق تغطية حل المشكلات للنموذج بشكل تكراري.
الأمان والتحكم البشري في الإجراءات ذات التداعيات المهمة
يؤدي منح الوكلاء تحكماً مباشراً في واجهات المرئية وسطور الأوامر إلى تقديم مخاطر أمنية تشغيلية. على عكس واجهات المحادثة النصية فقط، يمكن لوكلاء واجهة المستخدم الرسومية الذين يتفاعلون مع حقول الإدخال وأدوات التحكم في النظام إطلاق عمليات لا رجعة فيها، مثل تنفيذ المعاملات المالية، أو تعديل تكوينات النظام، أو حذف الملفات.
لإدارة المخاطر، يتضمن مسار إجراءات Qwen-UI-Agent آلية ask_user (سؤال المستخدم). يسمح هذا التصميم للوكيل بإيقاف التنفيذ مؤقتاً وطلب تأكيد صريح من المستخدم قبل المتابعة في الإجراءات الحساسة أو ذات التداعيات، مثل تفويض المدفوعات، أو منح الأذونات، أو حذف السجلات.
عندما يكتشف الوكيل مهام سير عمل حساسة، فإنه يعرض التسلسل المخطط له ويعيد التحكم إلى المستخدم. تضمن هذه الآلية التي تشرك العنصر البشري في الحلقة الحفاظ على الإشراف على القرارات الحاسمة. ويشير المؤلفون إلى أن تطوير معايير أمان أكثر منهجية وأهداف التحقق الرسمي يظل مجالاً مستمراً للبحث.
ما يحتاجه المطورون قبل نشر وكلاء واجهة المستخدم الرسومية
يتطلب نشر بنية وكيل واجهة مستخدم Qwen من علي بابا في البيئات العملية تقييم الحدود الأمنية، وموثوقية التنفيذ، ومراقبة البنية التحتية. نظراً لأن وكلاء الأساس المرئي يتفاعلون مباشرة مع واجهات الرسومات عبر التطبيقات دون الحاجة إلى واجهات برمجة تطبيقات مخصصة لكل تطبيق، يجب على المطورين إنشاء ضمانات على مستوى النظام.
أولاً، يجب على الفرق الهندسية تحديد حدود الأذونات. عندما يتم التصريح للوكلاء بتشغيل أوامر المحطة الطرفية، يجب أن يتم التنفيذ في بيئات تشغيل معزولة وغير مميزة لمنع المحتوى المرئي غير الموثوق به من تشغيل تنفيذ صدفة غير مصرح به على الأنظمة المضيفة.
ثانياً، يجب على الفرق تنفيذ استرداد الحالة من الأخطاء. نظراً لأن تطبيقات العالم الحقيقي تواجه تأخيرات في العرض وتغييرات في الواجهة، يجب على طبقة تسخير الوكيل مراقبة صحة التنفيذ، واكتشاف سير العمل المتوقف، ودعم آليات التراجع للحفاظ على سلامة المعاملات.

إدارة تسليم السياق عبر حدود التطبيقات
يعكس سير العمل المتعدد التطبيقات الذي تم عرضه في Qwen-UI-Agent أيضاً تحدياً أوسع لتصميم المنتجات: يحتاج سياق المهام بشكل متزايد إلى البقاء بعد الانتقالات بين التطبيقات المستقلة وبيئات التنفيذ. في بيئات تشغيل الوكلاء، يتم الحفاظ على هذا الاستمرار من خلال سجل التفاعل وطبقة التسخير التي تحافظ على السياق وحالة المهمة عبر التطبيقات المثبتة مسبقاً، والأجهزة، وبيئات التنفيذ.
يقدم توزيع تطبيقات الهاتف المحمول مشكلة معمارية مجاورة عندما يشير رحلة الوكيل أو المستخدم نحو تطبيق غير مثبت بعد على الجهاز. في هذه السيناريوهات، يتم مقاطعة تسليم السياق العادي داخل التطبيق بواسطة حدود تثبيت متجر التطبيقات. تعالج بنيات الربط المحمول المتخصصة، مثل OpoInstall، هذا الأمر من خلال توفير إمكانات الربط العميق المؤجل ونقل المعلمات المصممة لاستعادة معلمات الحملة، أو الوجهة، أو الإحالة المؤهلة عند الإطلاق الأول للتطبيق بعد التثبيت. تحل الآليتان مشكلات تقنية مختلفة عبر مراحل دورة حياة مختلفة، لكن كلاهما يسلط الضوء على المتطلبات المتزايدة لاستمرارية السياق الموثوقة عبر حدود التطبيقات المجزأة.
الأسئلة الشائعة (FAQ)
ما هو الفرق الأساسي بين Qwen-UI-Agent وسلفه MAI-UI؟
كيف ينفذ الوكيل أوامر واجهة سطر الأوامر جنباً إلى جنب مع عمليات واجهة المستخدم الرسومية؟
هل يستطيع Qwen-UI-Agent العمل على الأجهزة الفيزيائية دون بيئات اختبار وهمية محاكية؟
النقاط الرئيسية للفرق الهندسية
يمثل انتقال الذكاء الاصطناعي متعدد الوسائط نحو وكلاء واجهة المستخدم الرسومية الأساسيين تحولاً من تقييم المطالبات الثابتة إلى التنفيذ على الأجهزة الحقيقية عبر أنظمة التشغيل. مع اكتساب الوكلاء القدرة على تداخل النقرات المرئية مع تعليمات سطر الأوامر، يجب أن تتكيف بنيات البرمجيات لدعم تدفقات التفاعل المستقلة طويلة المدى.
يجب على الفرق الهندسية التي تستعد لنشر وكلاء واجهة المستخدم الرسومية إعطاء الأولوية لموثوقية مستوى النظام على مقاييس الأداء الخام. يتطلب بناء عمليات نشر مرنة إنشاء تسخير وكيل قوي، وتحديد حدود أذونات الامتياز الأقل، وتنفيذ آليات التراجع عن المعاملات، وتكامل تأكيد العنصر البشري في الحلقة (ask_user) للإجراءات ذات التداعيات. من خلال التصميم مع مراعاة عدم استقرار البيئة وإدارة الحالة، يمكن للمؤسسات نشر وكلاء واجهة المستخدم الأساسيين بضمانات تشغيلية أقوى.
المراجع
-
Zhou et al. Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents. https://arxiv.org/abs/2607.28227
-
Kong et al. MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments. https://tongyi-mai.github.io/MobileWorld/
-
Tongyi-MAI Team. Qwen-UI-Agent / MAI-UI Official Repository. https://github.com/Tongyi-MAI/MAI-UI
-
MAI-UI Team. Qwen-UI-Agent Official Project Page. https://tongyi-mai.github.io/Qwen-UI-Agent/
-
OpoInstall. How to Implement a Referral Tracking SDK with Deferred Deep Linking and Install Attribution. https://www.opoinstall.com/blog/referral-tracking-sdk-deferred-deep-linking
Share this article



