智东西(公众号:zhidxcom)
作者 |  陈骏达
编辑 |  李水青

智东西8月20日报道,今天,阿里巴巴推出了一款面向数字设备执行的GUI智能体基座模型——Qwen-UI-Agent。这一模型主要面向移动端、电脑端、网页端和深度搜索等环境,可以通过虚拟点击、CLI执行等方式操作设备,并完成复杂任务。

在项目主页显示的6个核心GUI基准测试中,Qwen-UI-Agent在其中5个里取得了第一,得分要高于GPT-5.6 Sol、Claude Opus 4.8等模型,也优于字节今年6月发布Seed 2.1 Pro。值得一提的是,这一模型的主力版本参数量仅为27B,基于Qwen 3.5系列基础模型打造。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

阿里展示了多个Qwen-UI-Agent的应用场景。用户可以要求模型在手机上通过模拟点击的方式打开地图,查找附近的咖啡馆,并到社交媒体平台搜索关于咖啡馆的评价,辅助用户决策。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

在PC上执行任务时,Qwen-UI-Agent则会执行更多CLI动作,并在单次决策中批量输出多个动作,完成跨网站调研产品、核对价格,生成比价方案等类型的任务。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

在深度搜索场景,这一模型的GUI能力和CLI能力可以协同完成任务,GUI负责网页检索与数据源定位,CLI负责数据下载与分析。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

此外,这一模型还可以被用于手机电脑跨端执行、PPT报告生成等任务,也可以主动关注设备上的消息通知等信息,并给用户提供推荐、方案等。

阿里同步发布了Qwen-UI-Agent模型的技术报告和项目主页。技术报告中,阿里透露为了训练这一模型,他们搭建了覆盖100+台真实手机、150+应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,除了27B版本之外,这一模型还提供了35B-A3B、4B参数量的版本。他们相信,GUI智能体有望成为现有数字设备上的通用执行器。

技术报告:

https://arxiv.org/abs/2607.28227

项目主页

https://tongyi-mai.github.io/Qwen-UI-Agent

GitHub:

https://github.com/Tongyi-MAI/MAI-UI

一、GUI智能体存在sim-to-real gap,中国应用独特生态带来额外挑战

GUI智能体的理想情况是,只要有界面,它就能像人一样看懂、点击、输入,替你完成复杂任务。但阿里团队发现,当前绝大多数GUI智能体都困在模拟器里:它们在干净的沙盒环境中刷分漂亮,一旦放到真实手机上,面对变化的界面、弹窗广告、登录过期、网络抖动,性能就会下跌。

这种“模拟环境到真实环境”的鸿沟(sim-to-real gap)在国内移动生态尤为严重,因为中国市场的超级应用功能深、入口杂、弹窗多,是实验室环境根本复现不了的。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

与此同时,真实用户的需求早已不局限于在单个App里点几下。一个完整的办公或生活工作流,往往需要在手机、电脑、浏览器之间来回跳转,甚至要求智能体主动感知,比如看到航班取消通知后,自动检索替代方案、检查日程冲突、生成恢复计划。

现有智能体大多是被动问答模式,等用户发指令才动,既不会跨端协作,也缺乏长程任务的规划与纠错能力。

更底层的问题是训练效率。传统GUI模型的数据收集高度依赖人工:人工写任务、搭环境、标结果、分析失败等等。随着智能体能力边界扩展,这套工作流已难以为继。

阿里认为,下一代GUI基座模型必须同时解决三大矛盾:模拟与真实的矛盾、单点能力与完整工作流的矛盾、人工驱动与规模化的矛盾。这正是Qwen-UI-Agent立项的出发点。

二、百台真机搭建移动运行时,多轮RL提升任务成功率

为了打造Qwen-UI-Agent,阿里设计了一套从底层环境、动作空间、训练范式到上层Harness的框架。

首先是真机训练环境。研究团队搭建了由100多台真实手机、150多款应用组成的真实移动运行时。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

这套系统配备了健康感知调度器,能实时监测每台设备的应用状态、账户登录态和网络状况,遇到故障自动切换;还支持虚拟屏幕技术,让单台手机同时运行多个应用会话,把并发rollout效率提升约20倍。

模型在训练阶段直接接触的就是真实登录态、动态内容和随机弹窗,这在一定程度上缓解了sim-to-real gap。

其次是统一动作空间。Qwen-UI-Agent把GUI操作、CLI命令(如bash脚本)和API调用纳入同一套动作体系。面对表格处理、文件批量操作等结构化任务,模型可以直接写代码执行。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

面对需要视觉确认的操作,比如在表格中填写、页面内搜索、地图缩放等等,则切回GUI点击。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

单次推理中,Qwen-UI-Agent还能输出批处理动作,一次性完成多个连贯操作,大幅减少交互轮次。

统计上,在OSWorld桌面任务中,CLI动作占比超过40%,批处理动作占比约40%。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

在训练层面,团队设计了一套“智能体驱动的数据飞轮”。整个流程由AI自动合成任务、自动搭建环境、自动验证结果、自动诊断失败并规划下一轮训练数据,人类只负责监督和修正。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

训练分三阶段:监督微调(SFT)建立基础能力;Action RL专门纠正定位错误、重复循环、过早终止等常见动作失误。

Online RL则在100步以上的长程轨迹中优化端到端成功率,同时调度近万个并发环境加速rollout。比如,模型在RL后会主动验证结果、发现错误后修复,而不是直接宣布成功。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

最上层是Harness层,负责主动服务和跨端协作。它能读取手机通知,主动识别航班取消等事件并生成执行计划。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

也能把跨设备任务串成工作流,让手机上的信息流转到电脑端继续处理。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

安全性方面,面对违法或高风险请求,Qwen-UI-Agent会不执行任何界面操作,直接拒绝并终止任务;面对支付、数据删除、隐私授权等敏感场景,则会在关键步骤主动停手,向用户说明情况,待获得明确确认后再继续。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

三、模型参数效率占优,弹窗广告等干扰执行

在覆盖移动端、桌面端、网页端和GUI定位的6大核心基准测试中,Qwen-UI-Agent拿下5项第一。

这一模型在移动端表现的表现相对出色,在真实设备评测集MobileWorld-Real上,它以92.2%的成功率大幅领先GPT-5.6 Sol、Claude Opus 4.8和字节 Seed 2.1 Pro,在AndroidDaily日常任务集上达到97.5%,接近满分。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

桌面端,它在OSWorld-Verified上获得79.5%,仅次于Claude Opus 4.8。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

论文还揭示了几个值得关注的量化结果与行为洞察。

一是模型的参数效率。Qwen-UI-Agent的27B版本超过多个厂商的旗舰模型,而35B-A3B版本在MobileWorld-Real上仍能达到87.4%,说明这套训练方法靠真实环境数据让中小模型获得了更强的任务完成率与部署性价比。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

二是RL训练改变了模型的工作习惯。动作RL后,模型不仅成功率提升7%以上,推理token还减少了21.3%,同时实际执行步骤增加了8.4%,说明它变得更果断,少了很多无意义的自我怀疑。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

在线RL也带来了变化,模型学会了“先验证、再交卷”,在OSWorld上包含验证动作的轨迹比例提升了14.7%,“假成功(自认为完成但实际失败)”的比例下降了11.2%。

模型还自发形成了跨模态协作模式,用命令行高效改状态,再切回界面截图确认效果。

这篇论文还分析了基线模型在真实手机上的失败原因。52%来自真实世界干扰,比如弹窗广告、UI误读、物理控件滑不准等等,40%来自执行能力缺陷,比如找不到深层入口、陷入重复点击循环、长程任务遗忘进度。这些发现证明了真机训练的必要性。

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

结语:GUI智能体进入真实世界,落地形态仍是关键命题

阿里在技术报告中透露,未来他们还将探索更高效的GUI执行,并通过更好的Harness优化模型的长程能力。训练方面,更可扩展的高保真合成环境也在探索范围之中,阿里已构建此类环境,但将它们整合到模型训练中的工作未能在技术报告发布前完成。

GUI智能体给AI的应用场景带来了更多想象空间,已成为国内字节、阶跃等AI玩家们探索的方向之一。阿里此前也曾发布MAI-UI等研究成果,此次新成果发布或许意味着他们将继续在这一方向投入资源。

不过,模型能力只是第一步。Qwen-UI-Agent未来会以何种形态落地到真实世界的设备之上,是值得关注的关键命题。