El agente UI Qwen de Alibaba controla teléfonos reales en 150 aplicaciones

opoinstall
2026-08-21
5 min read

¿Puede Qwen-UI-Agent controlar de forma fiable teléfonos reales e interfaces de escritorio? El informe técnico de la familia de modelos Qwen UI Agent de Alibaba demuestra un enfoque integral para unificar entornos móviles, de ordenador, de navegador y de investigación profunda bajo un único agente GUI fundamental. A medida que la inteligencia artificial multimodal transiciona de las indicaciones conversacionales a la ejecución directa, los modelos deben interactuar con las interfaces gráficas de usuario (GUI) de manera fiable y con mantenimiento de estado en diversas plataformas. Históricamente, automatizar interacciones entre sistemas operativos requería scripts personalizados frágiles o API específicas de plataforma. Hoy en día, debido a que los sistemas centrados en la visión pueden analizar dinámicamente diseños visuales y ejecutar comandos por lotes, los equipos de ingeniería están evaluando cómo construir, probar y desplegar agentes GUI fundamentales en entornos de dispositivos reales.

Por qué es importante Alibaba Qwen UI Agent para la automatización en dispositivos reales

De un vistazo

  • Qwen-UI-Agent alcanza resultados de vanguardia en evaluaciones de uso móvil, obteniendo un 82.1% en MobileWorld, un 92.2% en MobileWorld-Real y un 97.5% en AndroidDaily.
  • El modelo unifica entornos móviles, de ordenador, de navegador y de DeepSearch bajo un espacio de acción cohesivo centrado en la visión.
  • La infraestructura de desarrollo utiliza un clúster móvil físico en vivo compuesto por más de 100 teléfonos inteligentes que cubren más de 150 aplicaciones de consumo para la creación de tareas, entrenamiento y pruebas.

La evolución de los modelos fundamentales multimodales ha puesto de manifiesto un desafío operativo: los modelos de lenguaje de propósito general permanecen desconectados de las interfaces directas del sistema operativo. Aunque los asistentes conversacionales pueden procesar texto, analizar documentos y generar código, no pueden navegar de forma independiente por aplicaciones nativas de terceros, ejecutar logística de varios pasos o coordinar flujos de trabajo de escritorio complejos sin integraciones API estructuradas.

Para abordar estos límites de interfaz, Qwen-UI-Agent trata las pantallas digitales como un entorno de ejecución operativo unificado. Al combinar la base visual con la toma de decisiones secuencial, el modelo interpreta los diseños de interfaz en Android, Windows, macOS y navegadores web. El diseño del sistema y las métricas de evaluación se encuentran documentados en el informe técnico oficial.

Rendimiento de Qwen-UI-Agent en ocho benchmarks de GUI distintos y líneas base de comparación

La importancia de Qwen-UI-Agent radica en su énfasis en la ejecución en dispositivos reales. El equipo construyó un entorno de dispositivos reales de más de 100 teléfonos inteligentes físicos que abarcan más de 150 aplicaciones para la construcción de tareas, recopilación de trayectorias, entrenamiento y evaluación. Para medir el rendimiento en el mundo real, los investigadores introdujeron el benchmark MobileWorld-Real, que contiene más de 400 tareas en dispositivos reales distribuidas en más de 100 aplicaciones. El conjunto de benchmarks se detalla en la documentación del proyecto MobileWorld. El equipo mantiene materiales oficiales del proyecto y recursos de código a través del repositorio oficial de Qwen-UI-Agent / MAI-UI, con demostraciones adicionales alojadas en la página oficial del proyecto Qwen-UI-Agent.

Cómo funcionan juntos la GUI, la CLI y las acciones por lotes

Operar entornos modernos de ordenadores y dispositivos móviles requiere más que mapear coordenadas de puntero aisladas. Al ejecutar flujos de trabajo de varios pasos, un agente debe evaluar los estados de las aplicaciones, tener en cuenta los cambios dinámicos en el renderizado de la interfaz de usuario y gestionar las transiciones de interfaz de alta latencia. Para ampliar la eficiencia operativa, Qwen-UI-Agent introduce un espacio de acción unificado que combina operaciones de puntero GUI con la ejecución directa de la interfaz de línea de comandos (CLI).

En entornos de ordenadores de escritorio, los comandos CLI y los clics de GUI surgen como dos tipos de acción principales. El modelo puede emitir múltiples acciones en un solo turno de inferencia, estructurando aproximadamente el 40% de sus salidas de acción como comandos por lotes.

El flujo de acción híbrido

El siguiente diagrama ilustra cómo las entradas visuales se dirigen a través del espacio de acción unificado:

[Screen Vision Input]
        │
        ▼
[Qwen-UI-Agent Model] (Direct layout parsing & grounding)
        │
  ┌─────┴────────────────────────┐
  ▼                              ▼
[GUI Operations] (Click, Drag)  [CLI Operations] (Bash Commands)
  └─────┬────────────────────────┘
        ▼
[Batched Execution] (Multiple actions emitted per model turn)

Al intercalar operaciones GUI con la ejecución de CLI, el agente completa flujos de trabajo que de otro modo requerirían alternar entre ventanas separadas. En tareas multidispositivo, el agente puede analizar metadatos visuales de una pantalla móvil y ejecutar comandos de terminal para organizar directorios locales o manipular sistemas de archivos directamente.

Demostración de base visual de Alibaba Tongyi Qianwen ejecutando una tarea de búsqueda y verificación de múltiples pasos

Por qué 100 teléfonos reales importan más que los entornos aislados simulados

Evaluar agentes GUI multimodales en emuladores sintéticos a menudo introduce una brecha entre la simulación y la realidad. Los entornos sintéticos y aislados proporcionan condiciones de evaluación escalables y reproducibles, pero no pueden reproducir completamente los estados cambiantes de las aplicaciones, las condiciones de las cuentas, las redes y los fallos de interacción que se encuentran en los dispositivos en vivo. Al ser desplegados en hardware físico, los agentes se enfrentan frecuentemente a retrasos de animación impredecibles, notificaciones push en segundo plano o una conectividad celular fluctuante.

Para cerrar esta brecha, la tubería de desarrollo incorpora un banco de pruebas móvil físico de más de 100 teléfonos inteligentes que ejecutan más de 150 aplicaciones. Esta infraestructura captura la latencia genuina del dispositivo, las variaciones de renderizado y los casos límite de red durante el entrenamiento y la evaluación.

El benchmark MobileWorld-Real resultante está diseñado para exponer fallos que pueden quedar ocultos por entornos simulados y para evaluar el rendimiento bajo condiciones de dispositivos reales. Esta configuración subraya el valor de validar los modelos frente al comportamiento del sistema operativo en dispositivos reales.

Cómo el aprendizaje por refuerzo en línea escala las tareas GUI de larga duración

La ejecución de flujos de trabajo complejos con múltiples aplicaciones requiere una planificación sostenida a lo largo de secuencias extendidas. Las tareas complejas —como conciliar recibos de gastos en galerías móviles, generar hojas de cálculo en un escritorio y sincronizar archivos con almacenamiento remoto en la nube— a menudo exigen que los agentes ejecuten trayectorias que superan los 100 pasos. En la ejecución de larga duración, un error temprano de posicionamiento puede hacer que los pasos posteriores fallen.

Para mejorar la finalización de trayectorias, la tubería de entrenamiento utiliza aprendizaje por refuerzo (RL) en línea escalable. El sistema ejecuta simulaciones en aproximadamente 10,000 entornos paralelos simultáneamente para acelerar la generación de datos.

El marco de entrenamiento incorpora un volante de datos de estilo AutoResearch donde los agentes construyen tareas, generan entornos de verificación, diagnostican errores de ejecución y planifican iteraciones de entrenamiento posteriores. Este bucle automatizado reduce la carga de trabajo de ingeniería manual mientras amplía iterativamente la cobertura de resolución de problemas del modelo.

Seguridad y control humano en acciones trascendentales

Conceder a los agentes el control directo sobre interfaces visuales y líneas de comandos introduce riesgos de seguridad operativa. A diferencia de las interfaces conversacionales basadas únicamente en texto, los agentes GUI que interactúan con campos de entrada y controles del sistema pueden desencadenar operaciones irreversibles, tales como ejecutar transacciones financieras, modificar configuraciones del sistema o eliminar archivos.

Para gestionar el riesgo, el espacio de acción de Qwen-UI-Agent incluye un mecanismo ask_user. Este diseño permite que el agente pause la ejecución y solicite una confirmación explícita del usuario antes de proceder con acciones sensibles o trascendentales, como autorizar pagos, conceder permisos o eliminar registros.

Cuando el agente detecta flujos de trabajo sensibles, presenta su secuencia planificada y devuelve el control al usuario. Este mecanismo de intervención humana garantiza que el operador mantenga la supervisión sobre decisiones críticas. Los autores señalan que el desarrollo de benchmarks de seguridad más sistemáticos y objetivos de verificación formal sigue siendo un área de investigación en curso.

Lo que los desarrolladores necesitan antes de desplegar agentes GUI

Desplegar la arquitectura Alibaba Qwen UI Agent en entornos prácticos requiere evaluar los límites de seguridad, la fiabilidad de la ejecución y la supervisión de la infraestructura. Debido a que los agentes de bases visuales interactúan directamente con interfaces gráficas a través de aplicaciones sin requerir API dedicadas por aplicación, los desarrolladores deben establecer salvaguardas a nivel de sistema.

Primero, los equipos de ingeniería deben definir los límites de permisos. Cuando los agentes están autorizados para ejecutar comandos de terminal, la ejecución debe ocurrir en entornos de ejecución aislados y sin privilegios para evitar que contenido visual no confiable active una ejecución de shell no autorizada en los sistemas host.

Segundo, los equipos deben implementar una recuperación de errores con mantenimiento de estado. Debido a que las aplicaciones del mundo real experimentan retrasos de renderizado y cambios en la interfaz, la capa de soporte del agente debe supervisar la salud de la ejecución, detectar flujos de trabajo estancados y admitir mecanismos de reversión para mantener la integridad de las transacciones.

Qwen-UI-Agent ejecutando una tarea compleja de múltiples turnos a través de múltiples plataformas de escritorio y aplicaciones

Gestión de la transferencia de contexto entre límites de aplicaciones

Los flujos de trabajo multiaplicación demostrados en Qwen-UI-Agent también reflejan un desafío de diseño de producto más amplio: el contexto de las tareas necesita cada vez más sobrevivir a las transiciones entre aplicaciones independientes y entornos de ejecución. En los entornos de ejecución de agentes, esta continuidad se mantiene a través del historial de interacciones y la capa de soporte que preserva el contexto y el estado de la tarea en aplicaciones preinstaladas, dispositivos y entornos de ejecución.

La distribución de aplicaciones móviles introduce un problema arquitectónico adyacente cuando un agente o recorrido de usuario apunta hacia una aplicación que aún no está instalada en el dispositivo. En esos escenarios, la transferencia normal de contexto dentro de la aplicación se interrumpe por el límite de instalación de la tienda de aplicaciones. Las arquitecturas de enlaces móviles especializados, como OpoInstall, abordan esto proporcionando capacidades de enlaces profundos diferidos y transferencia de parámetros diseñadas para restaurar los parámetros elegibles de campaña, destino o recomendación en el primer lanzamiento posterior a la instalación de la aplicación. Los dos mecanismos resuelven diferentes problemas técnicos en distintas etapas del ciclo de vida, pero ambos ponen de relieve la creciente necesidad de una continuidad de contexto fiable a través de límites de aplicaciones fragmentados.

Preguntas frecuentes (FAQ)

¿Cuál es la diferencia principal entre Qwen-UI-Agent y su predecesor MAI-UI?
Qwen-UI-Agent es una continuación del proyecto MAI-UI, que amplía el trabajo anterior de agentes GUI hacia un agente fundamental más amplio para el mundo real que abarca entornos móviles, de ordenador, de navegador y de DeepSearch. Añade un espacio de acción unificado GUI/CLI, ejecución por lotes, infraestructura de dispositivos reales a gran escala y flujos de trabajo multiplataforma con mantenimiento de estado.
¿Cómo ejecuta el agente comandos CLI junto con operaciones GUI?
El modelo utiliza un espacio de acción unificado que intercala clics de puntero visual con comandos de terminal estándar. En entornos de escritorio, el agente puede analizar elementos de la interfaz de usuario, abrir una interfaz de línea de comandos y ejecutar scripts de shell para gestionar archivos y tareas del sistema, reduciendo el número de pasos discretos requeridos en comparación con la navegación puramente visual de apuntar y hacer clic.
¿Puede Qwen-UI-Agent operar en dispositivos físicos sin entornos aislados simulados?
Sí. Qwen-UI-Agent fue entrenado y evaluado utilizando un clúster móvil físico de más de 100 teléfonos inteligentes conectados que ejecutan aplicaciones de consumo del mundo real. Su puntuación del 92.2% en MobileWorld-Real proporciona evidencia de un sólido rendimiento en las condiciones de aplicación en dispositivos en vivo del benchmark.

Puntos clave para los equipos de ingeniería

La transición de la IA multimodal hacia agentes GUI fundamentales marca un cambio de la evaluación de indicaciones estáticas a la ejecución en dispositivos reales a través de sistemas operativos. A medida que los agentes adquieren la capacidad de intercalar clics visuales con instrucciones de línea de comandos, las arquitecturas de software deben adaptarse para admitir flujos de interacción autónomos de larga duración.

Los equipos de ingeniería que se preparen para desplegar agentes GUI deben priorizar la fiabilidad a nivel de sistema por encima de las métricas de rendimiento brutas. La construcción de despliegues resilientes requiere establecer soportes de agentes sólidos, definir límites de permisos de privilegio mínimo, implementar mecanismos de reversión de transacciones e integrar la confirmación con intervención humana (ask_user) para acciones trascendentales. Al diseñar teniendo en cuenta la inestabilidad del entorno y la gestión de estados, las organizaciones pueden desplegar agentes GUI fundamentales con salvaguardas operativas más sólidas.

Referencias

Share this article