알리바바 Qwen UI 에이전트, 150개 앱에서 실제 스마트폰 제어

opoinstall
2026-08-21
5 min read

Qwen-UI-Agent가 실제 스마트폰과 데스크톱 인터페이스를 안정적으로 제어할 수 있을까요? 알리바바 Qwen UI 에이전트 모델 패밀리에 대한 기술 보고서는 모바일, 컴퓨터, 브라우저, 심층 리서치 환경을 단일 파운데이션 GUI 에이전트로 통합하기 위한 포괄적인 접근 방식을 보여줍니다. 멀티모달 인공지능이 대화형 프롬프트에서 직접 실행 단계로 진화함에 따라, 모델은 다양한 플랫폼에서 안정적이고 상태(stateful)를 유지하는 방식으로 그래픽 사용자 인터페이스(GUI)와 상호작용해야 합니다. 역사적으로 운영체제 전반의 상호작용을 자동화하려면 취약한 커스텀 스크립트나 플랫폼별 API가 필요했습니다. 오늘날에는 시각 중심 시스템이 시각적 레이아웃을 동적으로 구문 분석하고 일괄 명령을 실행할 수 있게 되면서, 엔지니어링 팀은 실제 디바이스 환경에서 파운데이션 GUI 에이전트를 구축, 테스트 및 배포하는 방법을 평가하고 있습니다.

알리바바 Qwen UI 에이전트가 실제 디바이스 자동화에서 중요한 이유

핵심 요약

  • Qwen-UI-Agent는 모바일 사용 평가에서 MobileWorld 82.1%, MobileWorld-Real 92.2%, AndroidDaily 97.5%의 점수를 기록하며 최고 수준의 성능을 달성했습니다.
  • 본 모델은 모바일, 컴퓨터, 브라우저, DeepSearch 환경을 결합된 시각 중심 액션 스페이스로 통합합니다.
  • 개발 인프라에는 150개 이상의 소비자용 앱을 아우르는 100대 이상의 스마트폰으로 구성된 라이브 물리적 모바일 클러스터가 작업 생성, 학습, 테스트용으로 사용됩니다.

멀티모달 파운데이션 모델의 진화는 운영상의 과제를 드러냈습니다. 범용 언어 모델은 여전히 직접적인 운영체제 인터페이스와 분리되어 있다는 점입니다. 대화형 어시스턴트는 텍스트를 처리하고, 문서를 분석하며, 코드를 생성할 수 있지만, 구조화된 API 통합 없이는 타사 네이티브 앱을 독립적으로 탐색하고, 다단계 물류를 실행하거나, 복잡한 데스크톱 워크플로를 조율할 수 없습니다.

이러한 인터페이스 경계를 해결하기 위해 Qwen-UI-Agent는 디지털 화면을 통합된 운영 런타임으로 처리합니다. 시각적 그라운딩과 순차적 의사결정을 결합하여, 이 모델은 Android, Windows, macOS 및 웹 브라우저 전반의 인터페이스 레이아웃을 해석합니다. 시스템 설계와 평가 지표는 공식 기술 보고서에 문서화되어 있습니다.

8개의 서로 다른 GUI 벤치마크 및 비교 기준에서의 Qwen-UI-Agent 성능

Qwen-UI-Agent의 중요성은 실제 디바이스 실행에 대한 강조에 있습니다. 연구진은 작업 구축, 트래젝토리 수집, 학습 및 평가를 위해 100개 이상의 애플리케이션을 다루는 100대 이상의 물리적 스마트폰으로 구성된 실제 디바이스 환경을 구축했습니다. 실제 성능을 측정하기 위해 연구진은 100개 이상의 애플리케이션에 걸쳐 400개 이상의 실제 디바이스 작업을 포함하는 MobileWorld-Real 벤치마크를 도입했습니다. 벤치마크 스위트에 대한 자세한 내용은 MobileWorld 프로젝트 문서에서 확인할 수 있습니다. 연구팀은 Qwen-UI-Agent / MAI-UI 공식 저장소를 통해 공식 프로젝트 자료와 코드 리소스를 유지 관리하며, 추가적인 데모는 Qwen-UI-Agent 공식 프로젝트 페이지에서 호스팅됩니다.

GUI, CLI, 그리고 일괄 작업의 상호 연동 방식

현대적인 컴퓨터 및 모바일 환경을 운영하려면 고립된 포인터 좌표를 매핑하는 것 이상의 작업이 필요합니다. 다단계 워크플로를 실행할 때 에이전트는 애플리케이션 상태를 평가하고, 동적인 UI 렌더링 변경 사항을 고려하며, 지연 시간이 긴 인터페이스 전환을 처리해야 합니다. 운영 효율성을 높이기 위해 Qwen-UI-Agent는 GUI 포인터 작업과 직접적인 명령줄 인터페이스(CLI) 실행을 결합한 통합 액션 스페이스를 도입합니다.

데스크톱 컴퓨터 환경에서는 CLI 명령어와 GUI 클릭이 두 가지 주요 액션 유형으로 나타납니다. 모델은 단일 추론 턴에서 여러 액션을 발행할 수 있으며, 액션 출력의 약 40%가 일괄 명령(batched command)으로 구조화됩니다.

하이브리드 액션 플로우

아래 다이어그램은 시각적 입력이 통합 액션 스페이스를 통해 라우팅되는 방식을 보여줍니다.

[Screen Vision Input]
        │
        ▼
[Qwen-UI-Agent Model] (Direct layout parsing & grounding)
        │
  ┌─────┴────────────────────────┐
  ▼                              ▼
[GUI Operations] (Click, Drag)  [CLI Operations] (Bash Commands)
  └─────┬────────────────────────┘
        ▼
[Batched Execution] (Multiple actions emitted per model turn)

GUI 작업과 CLI 실행을 상호 인터리빙함으로써, 에이전트는 별도의 창 사이를 전환해야 하는 워크플로를 완료할 수 있습니다. 교차 디바이스 작업에서 에이전트는 모바일 화면에서 시각적 메타데이터를 구문 분석하고 터미널 명령을 실행하여 로컬 디렉터리를 정리하거나 파일 시스템을 직접 조작할 수 있습니다.

다단계 검색 및 검증 작업을 실행하는 알리바바 퉁이첸웬 시각적 그라운딩 데모

100대의 실제 스마트폰이 시뮬레이션된 샌드박스보다 중요한 이유

가상 에뮬레이터에서 멀티모달 GUI 에이전트를 평가하면 종종 시뮬레이션과 현실 간의 간극(sim-to-real gap)이 발생합니다. 합성 및 샌드박스 환경은 확장 가능하고 재현 가능한 평가 조건을 제공하지만, 라이브 디바이스에서 발생하는 변화하는 애플리케이션 상태, 계정 조건, 네트워크 및 상호작용 실패를 완전히 재현할 수 없습니다. 실제 하드웨어에 배포될 때 에이전트는 예측할 수 없는 애니메이션 지연, 백그라운드 푸시 알림, 변동하는 셀룰러 연결에 자주 직면합니다.

이 간극을 줄이기 위해 개발 파이프라인에는 150개 이상의 애플리케이션을 실행하는 100대 이상의 스마트폰으로 구성된 물리적 모바일 테스트베드가 포함되어 있습니다. 이 인프라는 학습 및 평가 과정에서 실제 디바이스의 지연 시간, 렌더링 변동 및 네트워크 엣지 케이스를 포착합니다.

결과물인 MobileWorld-Real 벤치마크는 시뮬레이션된 환경에 의해 가려질 수 있는 실패를 드러내고 실제 디바이스 조건에서의 성능을 평가하도록 설계되었습니다. 이 설정은 실제 디바이스 운영체제 동작에 대해 모델을 검증하는 것의 가치를 강조합니다.

온라인 강화학습(RL)이 장기 호라이즌 GUI 작업을 확장하는 방식

복잡한 다중 앱 워크플로를 실행하려면 확장된 시퀀스에 걸쳐 지속적인 계획이 필요합니다. 모바일 갤러리에서 비용 영수증 대조, 데스크톱에서 스프레드시트 생성, 원격 클라우드 스토리지로 파일 동기화와 같은 복잡한 작업은 종종 에이전트가 100단계를 초과하는 트래젝토리를 실행하도록 요구합니다. 장기 호라이즌 실행에서는 초기 위치 지정 오류로 인해 이후 단계가 실패할 수 있습니다.

트래젝토리 완료율을 향상시키기 위해 학습 파이프라인은 확장 가능한 온라인 강화학습(RL)을 활용합니다. 시스템은 데이터 생성을 가속화하기 위해 약 10,000개의 병렬 환경에서 동시에 롤아웃을 실행합니다.

학습 프레임워크에는 에이전트가 작업을 생성하고, 검증 환경을 구축하며, 실행 오류를 진단하고, 후속 학습 반복을 계획하는 AutoResearch 스타일의 데이터 플라이휠이 포함되어 있습니다. 이 자동화된 루프는 수동 엔지니어링 오버헤드를 줄이는 동시에 모델의 문제 해결 범위를 반복적으로 확장합니다.

중대형 작업에서의 안전성과 인간 제어

시각적 인터페이스와 명령줄에 대한 직접적인 제어권을 에이전트에 부여하면 운영 보안 리스크가 발생합니다. 텍스트 전용 대화형 인터페이스와 달리, 입력 필드 및 시스템 제어와 상호작용하는 GUI 에이전트는 금융 거래 실행, 시스템 구성 수정, 파일 삭제와 같은 돌이킬 수 없는 작업을 유발할 수 있습니다.

리스크를 관리하기 위해 Qwen-UI-Agent 액션 스페이스에는 ask_user 메커니즘이 포함되어 있습니다. 이 설계를 통해 에이전트는 결제 승인, 권한 부여, 레코드 삭제 등 민감하거나 중대한 작업을 진행하기 전에 실행을 일시 중지하고 명시적인 사용자 확인을 요청할 수 있습니다.

에이전트가 민감한 워크플로를 감지하면 계획된 시퀀스를 제시하고 제어권을 사용자에게 넘깁니다. 이 인간 참여형(human-in-the-loop) 메커니즘을 통해 운영자는 중요한 결정에 대한 통제력을 유지할 수 있습니다. 저자들은 보다 체계적인 안전성 벤치마크와 공식 검증 목표를 개발하는 것이 지속적인 연구 영역으로 남아 있음을 언급합니다.

GUI 에이전트 배포 전 개발자가 확인해야 할 사항

실제 환경에 알리바바 Qwen UI 에이전트 아키텍처를 배포하려면 보안 경계, 실행 신뢰성 및 인프라 모니터링을 평가해야 합니다. 시각적 파운데이션 에이전트는 전용 앱별 API 없이 애플리케이션 전반의 그래픽 인터페이스와 직접 상호작용하므로 개발자는 시스템 수준의 안전장치를 마련해야 합니다.

첫째, 엔지니어링 팀은 권한 경계를 정의해야 합니다. 에이전트에 터미널 명령 실행 권한이 부여된 경우, 신뢰할 수 없는 시각적 콘텐츠가 호스트 시스템에서 무단 셸 실행을 유발하는 것을 방지하기 위해 샌드박스 처리된 권한 없는 런타임에서 실행이 이루어져야 합니다.

둘째, 팀은 상태 기반(stateful) 오류 복구를 구현해야 합니다. 실제 애플리케이션은 렌더링 지연과 인터페이스 변경을 겪기 때문에, 에이전트 하네스 레이어는 실행 상태를 모니터링하고, 중단된 워크플로를 감지하며, 트랜잭션 무결성을 유지하기 위한 롤백 메커니즘을 지원해야 합니다.

다양한 데스크톱 플랫폼과 앱에 걸쳐 복잡한 멀티턴 작업을 실행하는 Qwen-UI-Agent

애플리케이션 경계를 넘나드는 컨텍스트 핸드오프 관리

Qwen-UI-Agent에서 시연된 다중 애플리케이션 워크플저는 더 넓은 제품 디자인 과제도 반영합니다. 작업 컨텍스트는 독립적인 애플리케이션과 실행 환경 간의 전환 과정에서 점점 더 유지될 필요가 있습니다. 에이전트 런타임에서 이 연속성은 상호작용 기록과, 사전 설치된 애플리케이션, 디바이스, 실행 환경 전반에 걸쳐 컨텍스트와 작업 상태를 보존하는 하네스 레이어를 통해 유지됩니다.

에이전트나 사용자 여정이 아직 디바이스에 설치되지 않은 애플리케이션을 가리킬 때, 모바일 앱 배포는 인접한 아키텍처 문제를 야기합니다. 이러한 시나리오에서는 정상적인 앱 내 컨텍스트 핸드오프가 앱 스토어 설치 경계에 의해 중단됩니다. OpoInstall과 같은 특화된 모바일 링크 아키텍처는 앱의 첫 설치 후 실행 시 적격한 캠페인, 목적지 또는 추천 파라미터를 복원하도록 설계된 지연된 딥 링크(deferred deep linking) 및 파라미터 패스스루 기능을 제공하여 이를 해결합니다. 두 메커니즘은 서로 다른 수명 주기 단계에서 서로 다른 기술적 문제를 해결하지만, 둘 다 조각화된 애플리케이션 경계를 넘어 신뢰할 수 있는 컨텍스트 연속성에 대한 증가하는 요구를 강조합니다.

자주 묻는 질문 (FAQ)

Qwen-UI-Agent와 이전 버전인 MAI-UI의 핵심 차이점은 무엇인가요?
Qwen-UI-Agent는 MAI-UI 프로젝트의 연장선상에 있으며, 모바일, 컴퓨터, 브라우저, DeepSearch 환경을 아우르는 더 넓은 실제 세상 중심의 파운데이션 에이전트로 기존 GUI 에이전트 작업을 확장합니다. 통합된 GUI/CLI 액션 스페이스, 일괄 실행, 대규모 실제 디바이스 인프라 및 상태 기반 크로스 플랫폼 워크플로를 추가했습니다.
에이전트는 GUI 작업과 함께 어떻게 CLI 명령을 실행하나요?
모델은 시각적 포인터 클릭과 표준 터미널 명령을 상호 인터리빙하는 통합 액션 스페이스를 활용합니다. 데스크톱 환경에서 에이전트는 UI 요소를 구문 분석하고, 명령줄 인터페이스를 열며, 셸 스크립트를 실행하여 파일 및 시스템 작업을 처리할 수 있으므로 순수 시각적 포인트 앤 클릭 내비게이션에 비해 필요한 개별 단계를 줄여줍니다.
Qwen-UI-Agent가 시뮬레이션된 샌드박스 없이 물리적 디바이스에서 작동할 수 있나요?
네. Qwen-UI-Agent는 실제 소비자용 앱을 실행하는 100대 이상의 연결된 스마트폰으로 구성된 물리적 모바일 클러스터를 사용하여 학습 및 평가되었습니다. 92.2%의 MobileWorld-Real 점수는 벤치마크의 라이브 디바이스 앱 조건 전반에서 강력한 성능을 발휘한다는 증거를 제공합니다.

엔지니어링 팀을 위한 핵심 시사점

멀티모달 AI가 파운데이션 GUI 에이전트로 진화하는 것은 정적 프롬프트 평가에서 운영체제 전반의 실제 디바이스 실행으로의 전환을 나타냅니다. 에이전트가 시각적 클릭과 명령줄 지침을 상호 인터리빙하는 능력을 획득함에 따라, 소프트웨어 아키텍처는 장기 호라이즌의 자율적 상호작용 플로우를 지원하도록 적응해야 합니다.

GUI 에이전트를 배포할 준비를 하는 엔지니어링 팀은 원시 벤치마크 지표보다 시스템 수준의 신뢰성을 우선시해야 합니다. 탄력적인 배포를 구축하려면 강력한 에이전트 하네스 구축, 최소 권한 권한 경계 정의, 트랜잭션 롤백 메커니즘 구현, 중대한 작업에 대한 인간 참여형 확인(ask_user) 통합이 필요합니다. 환경 불안정성과 상태 관리를 고려하여 설계함으로써 조직은 더 강력한 운영 안전장치를 갖춘 파운데이션 GUI 에이전트를 배포할 수 있습니다.

참고 문헌

Share this article