Qwen-UI-Agent技术报告:迈向下一代以真实世界为中心的GUI基础智能体
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
GUI agents(图形界面智能体)有潜力成为现有数字设备上的通用执行器。为将其推向实际应用,我们设想这样的智能体:能在真实设备上可靠运行,跨平台执行工作流,将GUI交互与CLI执行相结合,完成长时程任务,主动发起有用服务,并以最少的人力投入自主提升能力。在这一愿景的指导下,我们提出Qwen-UI-Agent,一个以真实世界为中心的通用GUI智能体,覆盖移动端、电脑端、网页和DeepSearch环境。Qwen-UI-Agent将多样化的沙盒环境与大规模真实设备移动运行时相结合。其统一动作空间将GUI操作与CLI执行交错进行,并在单次模型回合中生成批量动作。一个AutoResearch风格的数据飞轮利用智能体来构建任务和环境、诊断失败并规划后续迭代。在线强化学习支持超过100轮轨迹的训练,超过10,000个并发环境加速数据采集。一个轻量级封装层支持移动端和电脑端的主动服务发起及有状态工作流。
在广泛的评估套件中,Qwen-UI-Agent在移动端基准测试上达到最先进性能,同时在电脑端和浏览器端任务上与前沿模型(包括Opus 4.8、Gemini 3.1 Pro和GPT-5.6 Sol)相比表现出竞争力。在移动端使用中,它在MobileWorld上达到82.1%,在MobileWorld-Real上达到92.2%,在AndroidDaily上达到97.5%。在电脑端使用中,它在OSWorld-Verified上达到79.5%,在OSWorld-v2上获得40.0%的部分进展分数。在浏览器使用和GUI接地方面,它分别在WebArena上达到73.6%,在ScreenSpot-Pro上达到81.5%。