Qwen-UI-Agent peut-il contrôler de manière fiable de vrais téléphones et interfaces de bureau ? Le rapport technique de la famille de modèles d'agents d'interface Qwen d'Alibaba démontre une approche globale visant à unifier les environnements mobiles, informatiques, de navigation web et de recherche approfondie sous un agent d'interface graphique (GUI) de base unique. Alors que l'intelligence artificielle multimodale passe des invites textuelles à l'exécution directe, les modèles doivent interagir avec les interfaces graphiques de manière fiable et étatique sur diverses plateformes. Auparavant, l'automatisation des interactions entre systèmes d'exploitation nécessitait des scripts personnalisés fragiles ou des API spécifiques à chaque plateforme. Aujourd'hui, les équipes d'ingénierie évaluent la manière de concevoir, tester et déployer des agents d'interface de base dans des environnements sur appareils réels, portées par des systèmes visuels capables d'analyser dynamiquement les dispositions graphiques et d'exécuter des commandes groupées.
Pourquoi l'agent d'interface Qwen d'Alibaba compte pour l'automatisation sur de vrais appareils
En un coup d'œil
- Qwen-UI-Agent obtient des résultats de pointe sur les évaluations d'utilisateurs mobiles, avec des scores de 82,1 % sur MobileWorld, 92,2 % sur MobileWorld-Real et 97,5 % sur AndroidDaily.
- Le modèle unifie les environnements mobiles, informatiques, de navigation web et de recherche approfondie au sein d'un espace d'action visuel cohérent.
- L'infrastructure de développement utilise un cluster mobile physique en direct composé de plus de 100 smartphones couvrant plus de 150 applications grand public pour la création de tâches, l'entraînement et les tests.
L'évolution des modèles de fondation multimodaux a mis en lumière un défi opérationnel : les modèles de langage à usage général restent déconnectés des interfaces directes des systèmes d'exploitation. Si les assistants conversationnels peuvent traiter du texte, analyser des documents et générer du code, ils ne peuvent pas naviguer de manière autonome dans des applications natives tierces, exécuter des flux logistiques en plusieurs étapes ou coordonner des flux de travail de bureau complexes sans intégrations d'API structurées.
Pour surmonter ces barrières d'interface, Qwen-UI-Agent traite les écrans numériques comme un environnement d'exécution opérationnel unifié. En combinant l'ancrage visuel et la prise de décision séquentielle, le modèle interprète les dispositions d'interface sous Android, Windows, macOS et les navigateurs web. La conception du système et les mesures d'évaluation sont documentées dans le rapport technique officiel.

L'importance de Qwen-UI-Agent réside dans son accent mis sur l'exécution sur de vrais appareils. L'équipe a construit un environnement sur appareils réels composé de plus de 100 smartphones physiques et de plus de 150 applications pour la création de tâches, la collecte de trajectoires, l'entraînement et l'évaluation. Pour mesurer les performances dans le monde réel, les chercheurs ont introduit le benchmark MobileWorld-Real, qui contient plus de 400 tâches sur appareils réels réparties sur plus de 100 applications. La suite de benchmarks est détaillée dans la documentation du projet MobileWorld. L'équipe tient à jour les documents officiels du projet et les ressources de code via le dépôt officiel Qwen-UI-Agent / MAI-UI, et des démonstrations supplémentaires sont hébergées sur la page du projet officiel Qwen-UI-Agent.
Comment l'interface graphique, l'interface en ligne de commande et les actions groupées interagissent
L'exploitation d'environnements informatiques et mobiles modernes ne se limite pas au mappage de coordonnées de pointeur isolées. Lors de l'exécution de flux de travail en plusieurs étapes, un agent doit évaluer les états des applications, prendre en compte les changements de rendu visuel dynamiques et gérer les transitions d'interface à haute latence. Pour accroître l'efficacité opérationnelle, Qwen-UI-Agent introduit un espace d'action unifié qui associe des opérations de pointeur d'interface graphique à l'exécution directe via l'interface en ligne de commande (CLI).
Dans les environnements informatiques de bureau, les commandes CLI et les clics d'interface graphique constituent deux types d'action principaux. Le modèle peut émettre plusieurs actions en un seul tour d'inférence, environ 40 % de ses sorties d'action étant structurées sous forme de commandes groupées.
Le flux d'actions hybride
Le diagramme ci-dessous illustre la manière dont les entrées visuelles transitent par l'espace d'action unifié :
[Entrée visuelle de l'écran]
│
▼
[Modèle Qwen-UI-Agent] (Analyse directe de la mise en page et ancrage)
│
┌─────┴────────────────────────┐
▼ ▼
[Opérations GUI] (Clic, Glisser) [Opérations CLI] (Commandes Bash)
└─────┬────────────────────────┘
▼
[Exécution groupée] (Plusieurs actions émises par tour de modèle)
En imbriquant des opérations d'interface graphique et l'exécution de commandes CLI, l'agent réalise des flux de travail qui nécessiteraient autrement des basculements entre des fenêtres séparées. Dans les tâches inter-appareils, l'agent peut analyser les métadonnées visuelles d'un écran mobile et exécuter des commandes de terminal pour organiser des répertoires locaux ou manipuler directement les systèmes de fichiers.

Pourquoi 100 vrais téléphones comptent plus que des environnements isolés simulés
L'évaluation d'agents d'interface multimodaux dans des émulateurs synthétiques introduit souvent un écart entre simulation et réalité. Les environnements synthétiques et en bac à sable offrent des conditions d'évaluation évolutives et reproductibles, mais ils ne peuvent reproduire pleinement l'évolution des états applicatifs, des conditions de compte, des réseaux et des échecs d'interaction rencontrés sur des appareils en direct. Déployés sur du matériel physique, les agents font fréquemment face à des retards d'animation imprévisibles, à des notifications push en arrière-plan ou à une connectivité cellulaire fluctuante.
Pour combler cet écart, le pipeline de développement intègre un banc d'essai mobile physique de plus de 100 smartphones exécutant plus de 150 applications. Cette infrastructure capture la latence réelle des appareils, les variations de rendu et les cas limites du réseau lors de l'entraînement et de l'évaluation.
Le benchmark MobileWorld-Real qui en résulte est conçu pour exposer les défaillances susceptibles d'être masquées par les environnements simulés et pour évaluer les performances dans des conditions réelles d'utilisation. Cette configuration souligne l'importance de valider les modèles par rapport au comportement réel des systèmes d'exploitation mobiles.
Comment l'apprentissage par renforcement en ligne met à l'échelle les tâches d'interface à long horizon
L'exécution de flux de travail complexes multi-applications nécessite une planification soutenue sur des séquences prolongées. Les tâches complexes — telles que le rapprochement de reçus de frais dans les galeries mobiles, la génération de tableurs sur un bureau et la synchronisation de fichiers vers un stockage cloud distant — exigent souvent des agents qu'ils exécutent des trajectoires dépassant 100 étapes. Lors d'une exécution à long horizon, une erreur de positionnement précoce peut entraîner l'échec des étapes en aval.
Pour améliorer l'achèvement des trajectoires, le pipeline d'entraînement utilise l'apprentissage par renforcement (RL) en ligne évolutif. Le système exécute des déploiements simultanés sur environ 10 000 environnements parallèles afin d'accélérer la génération de données.
Le cadre d'entraînement intègre un volant de données de type AutoResearch où les agents construisent des tâches, génèrent des environnements de vérification, diagnostiquent les erreurs d'exécution et planifient les itérations d'entraînement ultérieures. Cette boucle automatisée réduit la charge d'ingénierie manuelle tout en élargissant de manière itérative la couverture de résolution de problèmes du modèle.
Sécurité et contrôle humain dans les actions à fort impact
Accorder aux agents un contrôle direct sur les interfaces visuelles et les lignes de commande engendre des risques de sécurité opérationnelle. Contrairement aux interfaces conversationnelles textuelles, les agents d'interface qui interagissent avec des champs de saisie et des commandes système peuvent déclencher des opérations irréversibles, telles que l'exécution de transactions financières, la modification de configurations système ou la suppression de fichiers.
Pour gérer les risques, l'espace d'action de Qwen-UI-Agent intègre un mécanisme de type ask_user. Cette conception permet à l'agent de suspendre son exécution et de demander une confirmation explicite à l'utilisateur avant de procéder à des actions sensibles ou importantes, telles que l'autorisation de paiements, l'octroi d'autorisations ou la suppression d'enregistrements.
Lorsque l'agent détecte des flux de travail sensibles, il présente sa séquence planifiée et rend le contrôle à l'utilisateur. Ce mécanisme de type « humain dans la boucle » garantit que l'opérateur conserve la supervision des décisions critiques. Les auteurs notent que le développement de benchmarks de sécurité plus systématiques et d'objectifs de vérification formelle reste un domaine de recherche actif.
Ce dont les développeurs ont besoin avant de déployer des agents d'interface
Le déploiement de l'architecture de l'agent d'interface Qwen d'Alibaba dans des environnements pratiques nécessite d'évaluer les limites de sécurité, la fiabilité d'exécution et la surveillance de l'infrastructure. Étant donné que les agents de fondation visuels interagissent directement avec les interfaces graphiques des applications sans nécessiter d'API dédiées par application, les développeurs doivent mettre en place des mesures de protection au niveau du système.
Premièrement, les équipes d'ingénierie doivent définir des limites de permissions. Lorsque les agents sont autorisés à exécuter des commandes de terminal, l'exécution doit avoir lieu dans des environnements d'exécution isolés et non privilégiés afin d'empêcher que des contenus visuels non vérifiés ne déclenchent une exécution de coque non autorisée sur les systèmes hôtes.
Deuxièmement, les équipes doivent mettre en œuvre une récupération d'erreur étatique. Les applications du monde réel subissant des retards de rendu et des modifications d'interface, la couche de pilotage de l'agent doit surveiller la santé de l'exécution, détecter les flux de travail bloqués et prendre en charge des mécanismes de restauration pour préserver l'intégrité des transactions.

Gestion du transfert de contexte entre les frontières applicatives
Les flux de travail multi-applications démontrés dans Qwen-UI-Agent reflètent également un défi de conception de produit plus large : le contexte des tâches doit de plus en plus survivre aux transitions entre des applications et des environnements d'exécution indépendants. Dans les environnements d'exécution d'agents, cette continuité est maintenue grâce à l'historique des interactions et à la couche de pilotage qui préserve le contexte et l'état des tâches à travers les applications préinstallées, les appareils et les environnements d'exécution.
La distribution d'applications mobiles introduit un problème architectural connexe lorsqu'un agent ou un parcours utilisateur pointe vers une application qui n'est pas encore installée sur l'appareil. Dans ces scénarios, le transfert de contexte normal au sein de l'application est interrompu par la limite d'installation de la boutique d'applications. Des architectures de liaison mobile spécialisées, telles que OpoInstall, résolvent ce problème en fournissant des fonctionnalités de liens profonds différés (deferred deep linking) et de transmission de paramètres conçues pour restaurer les paramètres de campagne, de destination ou de parrainage éligibles lors du tout premier lancement de l'application après son installation. Ces deux mécanismes résolvent des problèmes techniques différents à des étapes distinctes du cycle de vie, mais soulignent tous deux le besoin croissant d'une continuité de contexte fiable à travers des frontières applicatives fragmentées.
Foire aux questions (FAQ)
Quelle est la différence fondamentale entre Qwen-UI-Agent et son prédécesseur MAI-UI ?
Comment l'agent exécute-t-il des commandes CLI en parallèle des opérations d'interface graphique ?
Qwen-UI-Agent peut-il fonctionner sur des appareils physiques sans environnements isolés simulés ?
Points clés pour les équipes d'ingénierie
La transition de l'IA multimodale vers les agents d'interface de base marque un passage de l'évaluation statique d'invites à l'exécution sur de vrais appareils à travers les systèmes d'exploitation. À mesure que les agents acquièrent la capacité d'imbriquer des clics visuels et des instructions en ligne de commande, les architectures logicielles doivent s'adapter pour prendre en charge des flux d'interaction autonomes à long horizon.
Les équipes d'ingénierie qui se préparent à déployer des agents d'interface doivent privilégier la fiabilité au niveau du système par rapport aux simples métriques de benchmark. La construction de déploiements résilients nécessite la mise en place de structures de pilotage d'agents robustes, la définition de limites de permissions aux privilèges minimaux, l'implémentation de mécanismes de restauration des transactions et l'intégration d'une confirmation humaine (ask_user) pour les actions importantes. En concevant des solutions qui intègrent l'instabilité de l'environnement et la gestion des états, les organisations peuvent déployer des agents d'interface de base dotés de garanties opérationnelles renforcées.
Références
-
Zhou et al. Rapport technique Qwen-UI-Agent : Vers des agents d'interface de base centrés sur le monde réel de nouvelle génération. https://arxiv.org/abs/2607.28227
-
Kong et al. MobileWorld : Évaluation comparative d'agents mobiles autonomes dans des environnements interactifs agent-utilisateur et augmentés par MCP. https://tongyi-mai.github.io/MobileWorld/
-
Équipe Tongyi-MAI. Dépôt officiel Qwen-UI-Agent / MAI-UI. https://github.com/Tongyi-MAI/MAI-UI
-
Équipe MAI-UI. Page du projet officiel Qwen-UI-Agent. https://tongyi-mai.github.io/Qwen-UI-Agent/
-
OpoInstall. Comment implémenter un SDK de suivi des parrainages avec liens profonds différés (deferred deep linking) et attribution des installations. https://www.opoinstall.com/blog/referral-tracking-sdk-deferred-deep-linking
Share this article



