8月20日,阿里巴巴通义千问团队正式发布Qwen-UI-Agent,一款以真实世界为中心的GUI智能体基座模型。该模型让AI能够直接"看懂"屏幕界面,并像真人一样操作手机App、电脑软件和网页,功能覆盖移动端、电脑端、浏览器以及深度搜索(DeepSearch)环境,被视为GUI智能体从"能用"走向"好用"的关键一步。

一、真机训练:打通模拟到真实的最后一公里
长期以来,大多数GUI智能体在模拟环境中表现出色,却在真实设备上频频"翻车"——界面布局千变万化、应用逻辑复杂多样、真实场景中的中断和权限问题更是难以预测。Qwen-UI-Agent为解决这一根本性挑战,专门搭建了覆盖100+台真实手机、150+款应用的真机训练集群,用于任务构建、轨迹采集、模型训练与评测,并自建了MobileWorld-Real真机基准(400+任务、100+应用),确保模型能力的真实可靠。
在基准测试中,Qwen-UI-Agent全面对标乃至超越业界旗舰模型:移动端MobileWorld得分82.1%,分别领先GPT-5.6 Sol、Claude Opus 4.8达12.0和14.6个百分点;真机基准MobileWorld-Real高达92.2%;AndroidDaily更是接近满分97.5%。电脑端OSWorld-Verified达到79.5%,浏览器WebArena以73.6%位列所有对比模型第一。
二、GUI+CLI混合执行:让模型知道何时用界面,何时用命令
Qwen-UI-Agent的另一项核心创新在于引入了混合动作空间——模型不仅掌握常规的GUI操作(点击、滑动、输入),还能直接执行命令行(CLI)操作,并在单次决策中批量输出多个动作。这一设计让模型能够根据任务性质选择最优执行路径:处理界面交互时用GUI,遇到文件处理、数据整理等结构化任务时切换到CLI。
实测中,电脑任务中CLI动作占比接近一半,约40%的动作以批量形式输出,相比基线模型节省了58%的执行步数。结合超过100步超长轨迹的在线强化学习(RL)和约10,000个并发环境的并行Rollout,Qwen-UI-Agent能够稳定完成跨App购物、信息调研、多步骤办公等长程复杂任务。
安全方面,Qwen-UI-Agent将安全判断嵌入决策全程:违法或高风险请求直接拒绝并终止任务;支付、删除数据、隐私授权等敏感操作在关键步骤主动停手,向用户说明情况并等待确认,不擅自做主。
三、跨设备与主动服务:AI不只是被动执行工具
Qwen-UI-Agent还具备跨设备任务接力能力,用户可以在手机上发起复杂任务,切换到电脑端继续执行,实现真正的跨平台工作流。同时依托Harness框架,模型能够主动检测通知流中的可操作信号(如航班取消),主动推荐替代行程和调整方案,为用户提供"先一步想到"的服务体验。
在开源方面,MAI-UI已开放2B和8B两个规模的权重(发布于Hugging Face),技术报告见arXiv:2607.28227,项目主页和GitHub仓库均已上线(工具站入口:Qwen-UI-Agent 工具页)。旗舰权重尚未开放,但阿里云已基于同类技术推出"无影云手机Agentic Mobile"商业产品。
Qwen-UI-Agent的发布,标志着阿里在AI Agent领域完成了从模型能力展示到真实世界可用性的关键跃迁。GUI智能体的价值,不在于取代多少应用,而在于成为所有没有开放API的传统软件的通用操作层,让AI真正成为数字世界的执行器。


