8月23日,阿里巴巴推出Qwen-UI-Agent,这是一款GUI导向型基础智能体模型,能够通过直接理解屏幕元素在手机、PC、Web应用和深度搜索环境中执行点击、操作和多步骤任务。在多个权威GUI基准测试中,该模型据报告超越了GPT-5.6和Claude Opus 4.8等旗舰模型,在UI导航和任务完成方面展现出更强的可靠性。

一、从API到屏幕操作的跨越
许多智能体用例在需要操作真实桌面或移动软件而非API时会失败,而Qwen-UI-Agent的设计正是为了解决这一痛点。通过更强的GUI智能体基础模型,开发者可以将基于屏幕的任务——如RPA风格的工作流、企业应用导航或没有API的传统工具——视为一等自动化目标而非边缘情况。这意味着大量此前无法自动化的企业遗留系统,现在都可以通过智能体进行操作。
模型能够直接识别和理解屏幕上的按钮、菜单、输入框等UI元素,无需依赖API接口或DOM解析。这种“所见即所得”的操作方式大大降低了智能体开发的门槛,开发者不再需要为每个目标应用编写专门的接口代码。
二、多平台基准测试表现优异
在多个权威GUI基准测试中,Qwen-UI-Agent的表现超越了OpenAI的GPT-5.6和Anthropic的Claude Opus 4.8等旗舰模型。测试覆盖了UI导航、任务完成、错误恢复等多个维度,全面评估智能体在真实软件环境中的操作能力。
特别值得一提的是,模型在处理复杂多步骤任务时表现出色。例如,在需要填写多层表单、导航多个菜单页面的任务中,Qwen-UI-Agent能够准确理解每个步骤的目标,并做出正确的操作决策。同时,模型还具备错误检测与自动恢复能力,当操作未达到预期结果时,能够自动调整策略重新尝试。
三、企业应用场景广泛
Qwen-UI-Agent特别适合企业级应用场景。许多企业的核心业务系统是多年前开发的遗留系统,没有提供现代化的API接口,这使得自动化改造变得困难。Qwen-UI-Agent通过直接操作软件界面的方式,为这些系统提供了自动化可能。
此外,模型还集成了深度搜索能力,能够在复杂的信息环境中查找和整合数据。这一功能在企业数据分析、知识管理等场景中具有重要价值。开发团队建议,在部署前应识别两三个依赖人工点击复杂企业UI的重复性内部流程,使用Qwen-UI-Agent进行原型测试,评估成功率和错误特征。


