网易首页 > 网易号 > 正文 申请入驻

给电脑装个"嘴",AI才真正学会用电脑

0
分享至


你有没有想过一个问题:如果让你远程操作一台电脑,帮别人改一份Excel表格里几百行数据的格式,你会怎么做?

大概率你不会一个一个单元格去点右键改字体,你会打开一个脚本,写几行代码,唰地一下全改完了。可现在市面上大多数的AI电脑助手,干的却是前者的事。它们像一个只会用鼠标和键盘的实习生,一步一步地点击、拖拽、输入,17步才能改完一张表,还经常点错地方。

这就是这篇论文想解决的问题。

**当AI只会用手,不会用嘴**

先说说现在AI操作电脑的两条路子。

第一条路子最常见,叫"纯GUI"操作。

GUI(图形用户界面):就是我们平时看到的窗口、按钮、菜单这些可以用鼠标点击的界面。

AI通过截图看屏幕,然后模拟鼠标点击、键盘输入,跟人操作电脑的方式一模一样。这个办法的好处是通用,只要是个软件界面,理论上都能这么操作。但坏处也很明显:慢,而且容易出错。一个任务如果需要十几二十步操作,只要中间有一步点歪了,后面全乱套,这就是论文里说的"级联错误"。

第二条路子是给AI配上专门的工具或者API接口,让它可以直接调用软件提供的功能,不用一步步点。这样效率是高了,但代价是每个软件都得单独开发一套接口,费时费力,换个软件又得重新做一遍,根本没法规模化推广。

论文作者们的想法是:为什么不让AI也学会用命令行呢?

CLI:全称是Command-Line Interface(命令行界面),就是那个只有文字、没有图形按钮的黑框框,程序员写脚本、批量处理文件常用它。

命令行这东西是操作系统自带的,不需要额外开发,而且一行命令往往能顶几十次鼠标点击。你想批量把一百个文件改名,用鼠标一个个改可能要十分钟,用命令行一条命令几秒钟搞定。这就是论文标题里"HybridCUA"的核心思路:**让AI同时会用图形界面的手,也会用命令行的嘴,两者搭配着来。**

这就好比你请了一个家政阿姨,她既会用吸尘器一点点清理地板的犄角旮旯(这是GUI擅长的,处理那些必须靠"看"才能操作的视觉任务),也会用洗衣机一键洗完一大桶脏衣服(这是CLI擅长的,批量处理、重复操作)。如果这个阿姨只会用吸尘器吸衣服,那效率可想而知;如果她只会用洗衣机,那沙发缝里的灰尘她永远处理不了。真正厉害的阿姨,知道什么时候该用手,什么时候该按下那个"一键启动"的按钮。

**光给AI装个命令行,反而更差了**

这里有一件挺让人意外的事。

研究团队做了个实验,直接把命令行工具塞给几个现成的、挺厉害的AI模型,包括Qwen3.5-27B和EvoCUA-32B这些参数量不小的模型。按理说,工具多了应该更强吧?

结果恰恰相反。

四个测试的模型,在拿到命令行权限之后,在OSWorld这个基准测试上的准确率反而集体下滑,跌幅从2.5到11.5个百分点不等。

OSWorld:一个专门用来测试AI能不能像人一样操作真实电脑完成任务的评测基准,包含361个来自办公软件、系统设置、浏览器等各种场景的任务。

更有意思的是,即便给了命令行,这些模型也很少真正去用。Qwen3.5-27B只有15%的操作步骤用了命令行,而EvoCUA-32B干脆几乎不用,命令行使用率只有0.15%,等于形同虚设。

这说明了一个很关键的事实:**不是给AI一把新工具,它就自动会用。**

如果不搞清楚这一点会怎样?会出现"手里拿着螺丝刀,却还在用扳手拧螺丝"的尴尬场面。这些AI模型虽然理论上能访问命令行,但它们脑子里根本没有"这个任务应该用命令行来做"这根弦,也不知道命令怎么写才对,结果就是命令行成了摆设,甚至因为偶尔用错反而拖了后腿。瓶颈根本不在于"有没有工具",而在于"知不知道什么时候用、怎么用"。

**给AI"喂"三种不同的训练素材**

要让AI学会判断"这活儿该用手还是该用嘴",光靠现成的数据是不够的。

论文里提到一个很现实的困境:专门收集GUI操作的数据集里几乎全是点击拖拽,收集命令行和代码的数据集又完全脱离了图形界面的上下文。这两类数据像两条永不相交的平行线,谁也没法教会AI在真实的、图形化的电脑环境里,恰当地切换到命令行。

于是研究团队干了一件挺巧妙的事:**他们发现很多GUI操作序列,其实是能找到等价的命令行写法的。**这就好比你会发现,用鼠标一步步把文件从A文件夹拖到B文件夹,跟直接敲一行mv命令,效果是完全等价的,只是过程不同而已。既然如此,为什么不把现成的GUI操作"翻译"成命令行操作呢?

基于这个思路,他们搭建了一套数据生成流水线,产出了三种类型的轨迹(也就是AI完成一个任务的完整操作记录)。

第一种是纯GUI轨迹,来自开源的UI-MOPD数据集,把里面的每一步点击拖拽都改写成等价的PyAutoGUI代码(一种可以用代码模拟鼠标键盘操作的Python库),塞进统一的操作格式里。

第二种是纯CLI轨迹。研究人员先给每个应用(比如LibreOffice、GIMP这些软件)整理出一份专属的"命令行技能手册",列出这个软件有哪些命令行接口、常用命令是什么、典型用法长啥样。然后让一个叫Qwen3.8-27B的模型,只用命令行去完成任务,成功的记录就留下来。

第三种是最关键的混合轨迹,也就是GUI和CLI交替使用的操作记录。这里又分两条路:一条是让模型同时拥有两种工具,自己在执行过程中判断该用哪个;另一条是把之前纯GUI轨迹里适合改写的片段,直接转换成对应的命令行命令,重新跑一遍,只保留跑成功的版本。

最终这套流水线产出了5000条轨迹,加上3000个经过验证的强化学习任务,合称HybridCUA-8K。

值得一提的是,这些轨迹不是随便攒出来的。论文里给出了详细的应用领域分布:LibreOffice的三大件(Impress、Writer、Calc)各贡献了八百多条轨迹,多应用协同的场景贡献了786条。平均每条轨迹有10.4个逻辑步骤,最长的能到50步。

**训练分两步走:先学着模仿,再自己摸索**

光有数据还不够,怎么把这些数据"喂"给模型,让它真正学会判断,这是第二个技术难点。

论文里设计了一套两阶段训练框架。

第一阶段叫监督微调(SFT),说白了就是让模型照着已经验证过的正确操作轨迹去模仿学习。这一步教会模型两件事:一是统一的操作格式怎么写,二是在什么样的场景下切换接口是合理的。

第二阶段是强化学习(RLVR),这一步更有意思。传统的强化学习通常只看最后任务有没有完成,完成了就给奖励,这种做法有个明显的漏洞。

举个例子,如果一个任务本来三步命令行就能搞定,AI却绕了二十步GUI操作最后也蒙对了,传统的奖励机制照样给满分,因为它只认"结果"不认"过程"。反过来,如果AI在命令行上敲错了一个命令,只要最后瞎猫碰上死耗子把任务做完了,这次出错也不会受到任何惩罚。

**这种"唯结果论"的奖励方式,根本没法教会AI什么时候该用命令行、命令又该怎么写才靠谱。**

于是研究团队设计了两种"CLI感知"的奖励信号。

第一种是任务级别的CLI奖励,专门解决"该不该用"的问题。他们给3000个验证任务都打上了标签,标明这个任务用命令行是不是有明显优势(这个标签是怎么来的呢:对每个任务分别用纯GUI、纯CLI、混合三种方式各跑16次,比较成功率和步数,选出表现最好的方式作为标准答案)。如果AI跑出来的轨迹选择的接口跟标准答案对上了,而且任务也做成功了,就给额外奖励;选错了接口,哪怕蒙对了结果,也拿不到这份奖励。

第二种是步骤级别的执行奖励,专门解决"怎么用"的问题。每当AI执行的命令行命令报错了,这一步就会受到惩罚,不管最终任务有没有完成。这就像老师批改作业,不只是看最后的分数对不对,还要检查你解题过程中每一步的公式写得规不规范。

这个设计思路其实很像教小孩子学做家务。你不能只是在孩子把碗洗干净后夸一句"真棒",你还得告诉他,用洗碗机洗一大摞碗比手洗快,但洗那个祖传的手绘瓷碗最好还是手洗,别图省事扔进机器里洗坏了。如果只奖励"碗洗干净了"这个结果,孩子永远学不会判断什么时候该用什么方法,甚至可能因为某次手洗恰好蒙对了结果,而对该用洗碗机的场景也继续手洗。

**训练出来的模型到底强在哪**

说了这么多设计思路,最后还是得看数据说话。

研究团队用Qwen3.5-9B作为基础模型,经过前面说的两阶段训练,得到了最终的HybridCUA-9B。

先看最重要的对比:只用GUI跟GUI加CLI混合,效果差多少。基础模型Qwen3.5-9B在纯GUI模式下的准确率是38.8%,平均要走31.6步。有意思的是,如果只是简单粗暴地给这个基础模型加上命令行访问权限,不经过任何训练,准确率反而暴跌到18.4%,印证了前面说的"瞎给工具反而更差"的现象。

但是经过完整的两阶段训练之后,HybridCUA-9B的准确率飙升到53.6%,平均步数也压缩到了14.0步。这意味着相比训练前的基础模型,准确率提升了整整14.8个百分点,任务完成所需的步数几乎减半。

拿这个成绩去跟同规模的其他模型比一比。

|模型|接口类型|准确率|平均步数|

|Qwen3.5-27B|GUI|51.4%|25.7|

|EvoCUA-32B|GUI|56.7%|25.0|

|ToolCUA-8B|GUI+API|46.8%|14.9|

|AutoGLM-OS-9B|GUI+API|48.9%|-|

|UltraCUA-32B|GUI+API|43.7%|-|

|**HybridCUA-9B**|**GUI+CLI**|**53.6%**|**14.0**|

值得注意的是,HybridCUA-9B在参数量只有9B的情况下,超过了参数量四倍于它的UltraCUA-32B将近10个百分点,还比同样走"GUI加专用API"路线的ToolCUA-8B高出近7个百分点,而且步数更少。**这也印证了论文最初的判断:命令行这条路,比给每个软件单独开发专用接口的路子更划算。**

再来看一个很能说明问题的细节。前面提过,现成的模型即便有命令行也不太会用,比如EvoCUA-32B的命令行使用率只有0.15%。而HybridCUA-9B训练完之后,命令行使用率达到了64%,跟测试的模型里使用率最高的Claude-Opus5基本持平(67%)。但奇怪的是,Claude-Opus5虽然也大量用命令行,准确率却反而比它的纯GUI版本低了6.6个百分点。

这说明了一件事:**光是多用命令行不等于用得好,关键是知道该在哪些场景下用。**这就好比两个人都爱用计算器算账,一个人是心算能力不行,什么都依赖计算器,结果反而因为按错键出错更多;另一个人是清楚哪些复杂计算该用计算器、哪些心算更快更准,用得恰到好处。数量一样不代表质量一样。

**AI是怎么分配任务的**

论文里还做了一些很有意思的分析,看看训练好的HybridCUA-9B到底是怎么判断该用GUI还是CLI的。

结果显示,它的选择是有章法的,跟具体的应用场景和操作类型紧密相关。比如在操作系统相关的任务里(涉及文件、系统设置这类),命令行的使用率高达84%,因为这类任务本来就是命令行的强项,直接读写文件比在图形界面里翻箱倒柜快得多。而在浏览器相关的任务里,图形界面的使用率反而达到74%,毕竟网页内容主要靠"看",命令行很难替代视觉交互。

按操作类型细分也很有意思。内容编辑类操作有85.8%用了命令行,结果验证类操作更是高达98.4%都用命令行,因为这类任务本质上是直接的数据处理和状态检查,用脚本一条命令读出来比在界面里一个个点开检查快多了。相反,涉及空间位置调整的操作,58.4%还是靠图形界面完成的,因为这种"把这个东西挪到那个位置"的任务天然需要视觉反馈来判断对不对。

论文里还举了一个具体的例子,很能说明两种接口是怎么配合的。任务是给一篇作文的引言、正文、结论三个部分分别设置单倍行距、双倍行距和1.5倍行距,字号统一改成12号。

AI的操作是这样的:先用图形界面点击打开文档窗口和菜单(这一步必须靠"看"),然后切换到命令行,用python-docx这个库批量处理格式和行距,一次性把三个段落都改完并保存文件。到了验证环节更有意思,AI先用图形界面操作把菜单关掉,紧接着在同一个命令行动作里,重新打开保存好的文件,检查字号和行距设置是否正确,两个动作打包在一条命令里执行。

这个例子特别能体现"混合"的真正含义,不是简单地把GUI步骤和CLI步骤拼接起来,而是让两者在同一个任务里各自发挥所长,该看的时候看,该批量处理的时候批量处理,甚至在一步操作里就能把两种动作揉合在一起。

**跨平台会不会也好使**

一个方法如果只能在特定场景下管用,价值就要打折扣了。研究团队专门测试了HybridCUA-9B在两个陌生环境里的表现,看看它学到的这套"接口选择能力"能不能迁移。

第一个测试场景是OSWorld-MCP,这是在OSWorld任务基础上加了MCP工具支持的环境。

MCP:全称Model Context Protocol,一种让AI模型可以调用外部工具和服务的标准化协议。

结果HybridCUA-9B拿到了47.1%的准确率,比同样规模的Qwen3.5-9B高出9.1个百分点,跟专门做GUI-API集成的ToolCUA-8B基本打平。这说明训练时学到的"什么时候该用命令行"这套判断逻辑,即便换到一个带着全新工具生态的环境里,依然管用。

第二个测试场景更极端,直接换操作系统,跑到WindowsAgentArena(一个专门评测多模态智能体在Windows系统上表现的基准)上试试。

要知道,HybridCUA-9B训练的时候用的全是Linux环境的shell命令,Windows系统底层用的是完全不同的命令语法(PowerShell)。结果它在WindowsAgentArena上拿到了36.0%的成绩,比基础模型高出4个百分点,比ToolCUA-8B也高出2.2个百分点。更让人意外的是,论文里提到它甚至能自主写出PowerShell命令,虽然训练过程中它压根没见过一条PowerShell命令。

这个结果其实挺发人深省的。**它说明模型真正学到的,不是死记硬背某个操作系统的具体命令语法,而是一种更底层的判断能力,知道什么时候该把活儿交给命令行去干。**这就好比一个厨师如果只是背下了某个菜谱的具体步骤,换一家厨房、换一套厨具他可能就懵了;但如果他理解的是"炖肉需要小火慢煮、爆炒需要大火快炒"这套底层逻辑,那换到哪个厨房他都能照样掌勺。

**这套方法还有没有讲究**

论文里还做了几组对照实验,专门验证每个设计细节是不是真的有必要,这些细节挺值得说道说道的。

第一组实验测的是训练数据的搭配比例。如果只用纯GUI数据训练,准确率是43.2%;只用纯CLI数据训练,反而跌到31.7%;只用混合轨迹训练,是41.0%。而把三种数据混在一起训练,准确率达到46.0%,比单独用任何一种数据都要好。这说明三种类型的数据教给模型的是不同的能力,缺一不可,互相之间是互补而非替代的关系。

第二组实验拆解了强化学习阶段两种奖励信号各自的作用。如果去掉专门判断"该不该用CLI"的任务级奖励,模型的准确率影响不大,但命令行使用率只能达到58.9%(相比完整版的64%),效率提升也打了折扣,步数只缩短了18.2%(完整版能缩短29.3%)。反过来,如果去掉专门盯着"命令执行对不对"的步骤级奖励,准确率和步数看起来影响也不大,但命令行的执行错误率会慢慢回升到16.5%,甚至比训练前的基础模型还要差。

**这两组数据放在一起看,说明这两种奖励信号各管一段:一个负责教会模型什么时候伸手去够命令行,另一个负责教会模型伸手之后怎么把命令写对,两者缺了任何一个都会留下明显的短板。**

第三组实验测的是动作格式的设计。研究团队对比了两种做法:一种是把GUI和CLI分别做成两个独立的工具接口,让AI自己判断调用哪个;另一种是这篇论文采用的统一方案,把两种操作都塞进同一个叫bash的动作接口里。结果统一格式的准确率是46.0%,分离格式的准确率是38.8%,整整低了7.2个百分点。这说明把两种接口硬生生拆开反而会增加模型的认知负担,融合成一套统一语法,反而更容易学会灵活切换。

Q&A

Q1:HybridCUA是什么?

A:HybridCUA是一套让AI电脑助手学会同时使用图形界面操作和命令行操作的训练框架,核心思路是让AI既能像人一样点击鼠标,也能在合适的时候用一条命令代替几十次点击,从而提升任务完成的准确率和效率。

Q2:为什么直接给AI开放命令行权限反而会让效果变差?

A:因为现有的AI模型没有经过专门训练,不知道什么时候该用命令行、命令又该怎么写才对,实验显示四个代表性模型加了命令行权限后准确率反而下滑了2.5到11.5个百分点,说明问题不在于有没有工具,而在于会不会用。

Q3:HybridCUA-9B的实际表现如何?

A:在OSWorld基准测试上准确率达到53.6%,比基础模型提升14.8个百分点,平均操作步数也从31.6步降到14.0步,还在跨系统的WindowsAgentArena测试中取得36.0%的成绩,展现出较强的跨平台迁移能力。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
陈晓东买「1600万顶级迈巴赫」隐形财力超惊人 妻喜晒照:喜提爱车

陈晓东买「1600万顶级迈巴赫」隐形财力超惊人 妻喜晒照:喜提爱车

喜欢历史的阿繁
2026-10-09 04:54:34
73岁濮存昕车祸现场曝光!豪车和自行车相撞,被撞者瘫坐在地

73岁濮存昕车祸现场曝光!豪车和自行车相撞,被撞者瘫坐在地

错过美好
2026-10-09 03:48:47
不可思议!网传6名女生被安排无偿接机,辅导员只讲集体荣誉,她们就一句:要么发补贴,要么换人

不可思议!网传6名女生被安排无偿接机,辅导员只讲集体荣誉,她们就一句:要么发补贴,要么换人

王老师你还好吗
2026-10-09 16:49:16
藏不住了!许家印重大资产被挖出,186.5亿转给了“重庆李嘉诚”

藏不住了!许家印重大资产被挖出,186.5亿转给了“重庆李嘉诚”

数字财经智库
2026-10-08 16:53:54
国庆返程后,很多油车车主不说话了:堵3小时才发现 电车没那么惨

国庆返程后,很多油车车主不说话了:堵3小时才发现 电车没那么惨

趣味萌宠的日常
2026-10-07 19:57:28
四川一609分考生被西财会计学录取,到校学习一个多月后,却想退学复读,本人回应:想考警校!

四川一609分考生被西财会计学录取,到校学习一个多月后,却想退学复读,本人回应:想考警校!

凯旋学长
2026-10-09 17:06:37
俄最大炼油厂再遭袭,乌军攻入俄第二个州

俄最大炼油厂再遭袭,乌军攻入俄第二个州

名人苟或
2026-10-09 14:17:16
“我儿子周岁13,虚岁40”,家长无奈晒照片:跟中年男人没啥区别

“我儿子周岁13,虚岁40”,家长无奈晒照片:跟中年男人没啥区别

番外行
2026-10-09 09:39:16
广汽本田林志斌:雅阁的刹车踏板可承受3000N以上压力保持结构完整、不断裂

广汽本田林志斌:雅阁的刹车踏板可承受3000N以上压力保持结构完整、不断裂

IT之家
2026-10-09 14:59:27
奚梦瑶现身上海大师赛!把观赛席坐成了秀场 生图比精修还能打!

奚梦瑶现身上海大师赛!把观赛席坐成了秀场 生图比精修还能打!

手工制作阿歼
2026-10-09 17:25:20
深圳社保低基数历史结束了

深圳社保低基数历史结束了

凤眼论
2026-10-09 16:47:43
黑龙江望奎双汇“猪后鞧肉”林可霉素残留超标,双汇及其控股子公司被罚款近7000万元,双汇致歉:对现有食品安全管理体系进行全面整改完善

黑龙江望奎双汇“猪后鞧肉”林可霉素残留超标,双汇及其控股子公司被罚款近7000万元,双汇致歉:对现有食品安全管理体系进行全面整改完善

极目新闻
2026-10-09 20:43:11
终于明白为什么有些App打死都不适配鸿蒙系统了!

终于明白为什么有些App打死都不适配鸿蒙系统了!

呼呼历史论
2026-10-08 16:50:23
核弹已到位!泽连斯基发现大事不妙,不止朝鲜,普京又获一更强援

核弹已到位!泽连斯基发现大事不妙,不止朝鲜,普京又获一更强援

至死不渝的爱情
2026-10-09 04:02:14
演员向佐自曝把肾喝坏,肾功能相当于70岁老人,严重时走路都有问题……

演员向佐自曝把肾喝坏,肾功能相当于70岁老人,严重时走路都有问题……

上观新闻
2026-10-09 20:11:51
山东男篮逆转广东,班顿3项关键数据领跑全队,无愧持球大核

山东男篮逆转广东,班顿3项关键数据领跑全队,无愧持球大核

臻体育
2026-10-09 21:25:16
赵薇也被卷入电诈?央视曝光电诈头目:涉案超27亿

赵薇也被卷入电诈?央视曝光电诈头目:涉案超27亿

怪味历史连连看
2026-10-08 19:27:20
永州女局长周女士火了:这起离婚纠纷,早已不止是一场桃色瓜

永州女局长周女士火了:这起离婚纠纷,早已不止是一场桃色瓜

十为先生
2026-10-09 19:23:18
73岁濮存昕车祸现场被曝!对方自行车被卷车底,鞋掉瘫坐在地

73岁濮存昕车祸现场被曝!对方自行车被卷车底,鞋掉瘫坐在地

揽星河的笔记
2026-10-09 15:08:18
上海出身的顶级富二代获诺贝尔奖后,美国总统说:全世界都欠你一个大人情!

上海出身的顶级富二代获诺贝尔奖后,美国总统说:全世界都欠你一个大人情!

华人星光
2026-10-08 09:17:25
2026-10-09 22:56:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
10075文章数 570关注度
往期回顾 全部

科技要闻

华为小米手机同日涨价,最高涨1000元

头条要闻

七旬大伯在浙江买山景别墅养老 住进去后天天提心吊胆

头条要闻

七旬大伯在浙江买山景别墅养老 住进去后天天提心吊胆

体育要闻

与C罗硬碰硬,一个72岁老人的倔强

娱乐要闻

吴奇隆宣布重要决定,走上谢霆锋老路

财经要闻

时隔12年,公募基金运作办法修订

汽车要闻

2027款深蓝L06及追风版上市 限时权益价11.49万元起

态度原创

艺术
手机
本地
公开课
军事航空

艺术要闻

巴斯奇亚24岁画的《古代科学家》,7697.5万!

手机要闻

鸿蒙7彻底杀疯了!5.0版本一夜归零,Mate60老用户终于等到这一天

本地新闻

转型再出发 奋勇打头阵

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

直击南部战区海军某部重装空投训练

无障碍浏览 进入关怀版