网易首页 > 网易号 > 正文 申请入驻

阿里把AI扔进100台真机里“军训”,玩转各种屏幕!这和AI手机还有啥区别?

0
分享至


智东西
作者 陈骏达
编辑 李水青

智东西8月20日报道,今天,阿里巴巴推出了一款面向数字设备执行的GUI智能体基座模型——Qwen-UI-Agent。这一模型主要面向移动端、电脑端、网页端和深度搜索等环境,可以通过虚拟点击、CLI执行等方式操作设备,并完成复杂任务。

在项目主页显示的6个核心GUI基准测试中,Qwen-UI-Agent在其中5个里取得了第一,得分要高于GPT-5.6 Sol、Claude Opus 4.8等模型,也优于字节今年6月发布Seed 2.1 Pro。值得一提的是,这一模型的主力版本参数量仅为27B,基于Qwen 3.5系列基础模型打造。


阿里展示了多个Qwen-UI-Agent的应用场景。用户可以要求模型在手机上通过模拟点击的方式打开地图,查找附近的咖啡馆,并到社交媒体平台搜索关于咖啡馆的评价,辅助用户决策。


在PC上执行任务时,Qwen-UI-Agent则会执行更多CLI动作,并在单次决策中批量输出多个动作,完成跨网站调研产品、核对价格,生成比价方案等类型的任务。


在深度搜索场景,这一模型的GUI能力和CLI能力可以协同完成任务,GUI负责网页检索与数据源定位,CLI负责数据下载与分析。

此外,这一模型还可以被用于手机电脑跨端执行、PPT报告生成等任务,也可以主动关注设备上的消息通知等信息,并给用户提供推荐、方案等。

阿里同步发布了Qwen-UI-Agent模型的技术报告和项目主页。技术报告中,阿里透露为了训练这一模型,他们搭建了覆盖100+台真实手机、150+应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,除了27B版本之外,这一模型还提供了35B-A3B、4B参数量的版本。他们相信,GUI智能体有望成为现有数字设备上的通用执行器。

技术报告:

https://arxiv.org/abs/2607.28227

项目主页

https://tongyi-mai.github.io/Qwen-UI-Agent

GitHub:

https://github.com/Tongyi-MAI/MAI-UI

一、GUI智能体存在sim-to-real gap,中国应用独特生态带来额外挑战

GUI智能体的理想情况是,只要有界面,它就能像人一样看懂、点击、输入,替你完成复杂任务。但阿里团队发现,当前绝大多数GUI智能体都困在模拟器里:它们在干净的沙盒环境中刷分漂亮,一旦放到真实手机上,面对变化的界面、弹窗广告、登录过期、网络抖动,性能就会下跌。

这种“模拟环境到真实环境”的鸿沟(sim-to-real gap)在国内移动生态尤为严重,因为中国市场的超级应用功能深、入口杂、弹窗多,是实验室环境根本复现不了的。


与此同时,真实用户的需求早已不局限于在单个App里点几下。一个完整的办公或生活工作流,往往需要在手机、电脑、浏览器之间来回跳转,甚至要求智能体主动感知,比如看到航班取消通知后,自动检索替代方案、检查日程冲突、生成恢复计划。

现有智能体大多是被动问答模式,等用户发指令才动,既不会跨端协作,也缺乏长程任务的规划与纠错能力。

更底层的问题是训练效率。传统GUI模型的数据收集高度依赖人工:人工写任务、搭环境、标结果、分析失败等等。随着智能体能力边界扩展,这套工作流已难以为继。

阿里认为,下一代GUI基座模型必须同时解决三大矛盾:模拟与真实的矛盾、单点能力与完整工作流的矛盾、人工驱动与规模化的矛盾。这正是Qwen-UI-Agent立项的出发点。

二、百台真机搭建移动运行时,多轮RL提升任务成功率

为了打造Qwen-UI-Agent,阿里设计了一套从底层环境、动作空间、训练范式到上层Harness的框架。

首先是真机训练环境。研究团队搭建了由100多台真实手机、150多款应用组成的真实移动运行时。


这套系统配备了健康感知调度器,能实时监测每台设备的应用状态、账户登录态和网络状况,遇到故障自动切换;还支持虚拟屏幕技术,让单台手机同时运行多个应用会话,把并发rollout效率提升约20倍。

模型在训练阶段直接接触的就是真实登录态、动态内容和随机弹窗,这在一定程度上缓解了sim-to-real gap。

其次是统一动作空间。Qwen-UI-Agent把GUI操作、CLI命令(如bash脚本)和API调用纳入同一套动作体系。面对表格处理、文件批量操作等结构化任务,模型可以直接写代码执行。


面对需要视觉确认的操作,比如在表格中填写、页面内搜索、地图缩放等等,则切回GUI点击。


单次推理中,Qwen-UI-Agent还能输出批处理动作,一次性完成多个连贯操作,大幅减少交互轮次。

统计上,在OSWorld桌面任务中,CLI动作占比超过40%,批处理动作占比约40%。


在训练层面,团队设计了一套“智能体驱动的数据飞轮”。整个流程由AI自动合成任务、自动搭建环境、自动验证结果、自动诊断失败并规划下一轮训练数据,人类只负责监督和修正。


训练分三阶段:监督微调(SFT)建立基础能力;Action RL专门纠正定位错误、重复循环、过早终止等常见动作失误。

Online RL则在100步以上的长程轨迹中优化端到端成功率,同时调度近万个并发环境加速rollout。比如,模型在RL后会主动验证结果、发现错误后修复,而不是直接宣布成功。


最上层是Harness层,负责主动服务和跨端协作。它能读取手机通知,主动识别航班取消等事件并生成执行计划。


也能把跨设备任务串成工作流,让手机上的信息流转到电脑端继续处理。

安全性方面,面对违法或高风险请求,Qwen-UI-Agent会不执行任何界面操作,直接拒绝并终止任务;面对支付、数据删除、隐私授权等敏感场景,则会在关键步骤主动停手,向用户说明情况,待获得明确确认后再继续。

三、模型参数效率占优,弹窗广告等干扰执行

在覆盖移动端、桌面端、网页端和GUI定位的6大核心基准测试中,Qwen-UI-Agent拿下5项第一。

这一模型在移动端表现的表现相对出色,在真实设备评测集MobileWorld-Real上,它以92.2%的成功率大幅领先GPT-5.6 Sol、Claude Opus 4.8和字节 Seed 2.1 Pro,在AndroidDaily日常任务集上达到97.5%,接近满分。


桌面端,它在OSWorld-Verified上获得79.5%,仅次于Claude Opus 4.8。


论文还揭示了几个值得关注的量化结果与行为洞察。

一是模型的参数效率。Qwen-UI-Agent的27B版本超过多个厂商的旗舰模型,而35B-A3B版本在MobileWorld-Real上仍能达到87.4%,说明这套训练方法靠真实环境数据让中小模型获得了更强的任务完成率与部署性价比。


二是RL训练改变了模型的工作习惯。动作RL后,模型不仅成功率提升7%以上,推理token还减少了21.3%,同时实际执行步骤增加了8.4%,说明它变得更果断,少了很多无意义的自我怀疑。


在线RL也带来了变化,模型学会了“先验证、再交卷”,在OSWorld上包含验证动作的轨迹比例提升了14.7%,“假成功(自认为完成但实际失败)”的比例下降了11.2%。

模型还自发形成了跨模态协作模式,用命令行高效改状态,再切回界面截图确认效果。

这篇论文还分析了基线模型在真实手机上的失败原因。52%来自真实世界干扰,比如弹窗广告、UI误读、物理控件滑不准等等,40%来自执行能力缺陷,比如找不到深层入口、陷入重复点击循环、长程任务遗忘进度。这些发现证明了真机训练的必要性。


结语:GUI智能体进入真实世界,落地形态仍是关键命题

阿里在技术报告中透露,未来他们还将探索更高效的GUI执行,并通过更好的Harness优化模型的长程能力。训练方面,更可扩展的高保真合成环境也在探索范围之中,阿里已构建此类环境,但将它们整合到模型训练中的工作未能在技术报告发布前完成。

GUI智能体给AI的应用场景带来了更多想象空间,已成为国内字节、阶跃等AI玩家们探索的方向之一。阿里此前也曾发布MAI-UI等研究成果,此次新成果发布或许意味着他们将继续在这一方向投入资源。

不过,模型能力只是第一步。Qwen-UI-Agent未来会以何种形态落地到真实世界的设备之上,是值得关注的关键命题。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1976年她的墓葬出土了,终于证明不是神话人物,而是真实存在的

1976年她的墓葬出土了,终于证明不是神话人物,而是真实存在的

掠影后有感
2026-08-19 09:58:17
婚内出轨越来越多,婚姻律师说实话:不是人心变坏,是成本太低

婚内出轨越来越多,婚姻律师说实话:不是人心变坏,是成本太低

游戏收藏指南
2026-08-21 14:28:35
比山口百惠还美丽的那位女子,在她93岁时安静地去往天国

比山口百惠还美丽的那位女子,在她93岁时安静地去往天国

我来我看见
2026-08-19 20:56:44
“一年最多做4次!”医生:多了破坏屏障,易感染!切记要留一根

“一年最多做4次!”医生:多了破坏屏障,易感染!切记要留一根

环球网资讯
2026-08-18 08:54:38
韩国娱乐圈环境有多变态?

韩国娱乐圈环境有多变态?

浪子说
2026-08-20 00:40:03
山东省淄博市公安局

山东省淄博市公安局

爱意随风起呀
2026-08-21 12:18:41
U16国少和平杯赛程:9月将分别迎战吉尔吉斯、越南与澳大利亚

U16国少和平杯赛程:9月将分别迎战吉尔吉斯、越南与澳大利亚

懂球帝
2026-08-21 16:37:12
她是上海"鱼子酱女王"  ,二婚嫁大16岁高曙光,不反对丈夫和江珊来往,如今把生活过成顶配

她是上海"鱼子酱女王" ,二婚嫁大16岁高曙光,不反对丈夫和江珊来往,如今把生活过成顶配

她时尚丫
2026-08-21 16:26:29
曝齐尔克泽同意加盟意甲双雄,只等曼联选择!阿森纳欲签红魔二少

曝齐尔克泽同意加盟意甲双雄,只等曼联选择!阿森纳欲签红魔二少

罗米的曼联博客
2026-08-21 11:18:45
前国脚:足协接受性贿赂不算啥事!就是运气差被查到了 都怪韩国

前国脚:足协接受性贿赂不算啥事!就是运气差被查到了 都怪韩国

念洲
2026-08-21 07:16:08
“吃个梭子蟹,有什么可高贵的?”江浙沪独女的新型炫耀,再次翻车了

“吃个梭子蟹,有什么可高贵的?”江浙沪独女的新型炫耀,再次翻车了

妍妍教育日记
2026-08-18 09:20:09
42岁港星定居深圳被投诉扰民,和邻居沟通态度差,回怼嫌吵买别墅

42岁港星定居深圳被投诉扰民,和邻居沟通态度差,回怼嫌吵买别墅

晋哥说电影
2026-08-21 16:37:20
非必要不做肠镜?医生提醒:只要做过肠镜,这7件事一定要多注意

非必要不做肠镜?医生提醒:只要做过肠镜,这7件事一定要多注意

叙说医疗健康
2026-07-25 06:00:22
两千万人倒下,换的不是某套制度,而是"站着活"的权利?

两千万人倒下,换的不是某套制度,而是"站着活"的权利?

你在偷看谁
2026-08-12 20:01:53
萨拉赫主场首秀打满全场球队0-1负,6射1正送出4次关键传球

萨拉赫主场首秀打满全场球队0-1负,6射1正送出4次关键传球

懂球帝
2026-08-21 07:26:06
国乒从“养狼”到“关门”。松岛辉空曾说:“在中国练一个月,顶在日本打一年”。

国乒从“养狼”到“关门”。松岛辉空曾说:“在中国练一个月,顶在日本打一年”。

乒乓乐园
2026-08-20 01:04:04
天文学家彭罗斯:人类的死亡只是宇宙的幻象,生命是不可能终结的

天文学家彭罗斯:人类的死亡只是宇宙的幻象,生命是不可能终结的

掠影后有感
2026-08-21 10:12:34
汇丰银行斥资6800万美元,开启金融危机以来最大规模资深银行家裁员潮

汇丰银行斥资6800万美元,开启金融危机以来最大规模资深银行家裁员潮

新浪财经
2026-08-21 14:17:42
世锦赛:决胜局4-11绝境重生!梁伟铿/王昶2-1掀翻前世界第一

世锦赛:决胜局4-11绝境重生!梁伟铿/王昶2-1掀翻前世界第一

钉钉陌上花开
2026-08-20 21:05:55
早起和睡前的8大“短命”习惯,越早改掉越长寿!

早起和睡前的8大“短命”习惯,越早改掉越长寿!

环京快爆
2026-08-20 08:55:37
2026-08-21 17:20:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12478文章数 117160关注度
往期回顾 全部

科技要闻

阿里AI的两面:云赚56亿,千问烧掉138亿

头条要闻

孕妇租房刚搬家几天 房东反悔欲将其赶走:借死不借生

头条要闻

孕妇租房刚搬家几天 房东反悔欲将其赶走:借死不借生

体育要闻

续哈登+招沃特森=骑士赌了

娱乐要闻

冯绍峰七夕带儿子游玩!次日聚会

财经要闻

三部门发布多条促内需优化政策

汽车要闻

11.99万起!北京现代艾尼氪V成都车展开启预售

态度原创

亲子
本地
时尚
旅游
公开课

亲子要闻

安吉拉和艾登开学后,我和杰森每天时间安排的满满的,看着孩子一天天长大,挺有成就感

本地新闻

《牛来》的一声“妈妈”,到底多少人被精神污染了

带火“活人感”妆容,让刘亦菲也排队等,她到底什么来头?

旅游要闻

传统旅游行业大洗牌:2400多家旅行社退出,导游经历转型阵痛期

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版