ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

给电脑装个“嘴“,AI才真正学会用电脑

给电脑装个“嘴“,AI才真正学会用电脑 你有没有想过一个问题如果让你远程操作一台电脑帮别人改一份Excel表格里几百行数据的格式你会怎么做大概率你不会一个一个单元格去点右键改字体你会打开一个脚本写几行代码唰地一下全改完了。可现在市面上大多数的AI电脑助手干的却是前者的事。它们像一个只会用鼠标和键盘的实习生,一步一步地点击、拖拽、输入17步才能改完一张表还经常点错地方。这就是这篇论文想解决的问题。**当AI只会用手不会用嘴**先说说现在AI操作电脑的两条路子。第一条路子最常见叫纯GUI操作。GUI图形用户界面就是我们平时看到的窗口、按钮、菜单这些可以用鼠标点击的界面。AI通过截图看屏幕然后模拟鼠标点击、键盘输入跟人操作电脑的方式一模一样。这个办法的好处是通用只要是个软件界面理论上都能这么操作。但坏处也很明显慢而且容易出错。一个任务如果需要十几二十步操作只要中间有一步点歪了后面全乱套这就是论文里说的级联错误。第二条路子是给AI配上专门的工具或者API接口让它可以直接调用软件提供的功能,不用一步步点。这样效率是高了但代价是每个软件都得单独开发一套接口费时费力换个软件又得重新做一遍根本没法规模化推广。论文作者们的想法是为什么不让AI也学会用命令行呢CLI全称是Command-Line Interface命令行界面就是那个只有文字、没有图形按钮的黑框框程序员写脚本、批量处理文件常用它。命令行这东西是操作系统自带的不需要额外开发而且一行命令往往能顶几十次鼠标点击。你想批量把一百个文件改名用鼠标一个个改可能要十分钟用命令行一条命令几秒钟搞定。这就是论文标题里HybridCUA的核心思路**让AI同时会用图形界面的手也会用命令行的嘴两者搭配着来。**这就好比你请了一个家政阿姨她既会用吸尘器一点点清理地板的犄角旮旯这是GUI擅长的处理那些必须靠看才能操作的视觉任务也会用洗衣机一键洗完一大桶脏衣服这是CLI擅长的批量处理、重复操作。如果这个阿姨只会用吸尘器吸衣服那效率可想而知如果她只会用洗衣机那沙发缝里的灰尘她永远处理不了。真正厉害的阿姨,知道什么时候该用手什么时候该按下那个一键启动的按钮。**光给AI装个命令行反而更差了**这里有一件挺让人意外的事。研究团队做了个实验直接把命令行工具塞给几个现成的、挺厉害的AI模型包括Qwen3.5-27B和EvoCUA-32B这些参数量不小的模型。按理说工具多了应该更强吧结果恰恰相反。四个测试的模型在拿到命令行权限之后在OSWorld这个基准测试上的准确率反而集体下滑跌幅从2.5到11.5个百分点不等。OSWorld一个专门用来测试AI能不能像人一样操作真实电脑完成任务的评测基准包含361个来自办公软件、系统设置、浏览器等各种场景的任务。更有意思的是即便给了命令行这些模型也很少真正去用。Qwen3.5-27B只有15%的操作步骤用了命令行而EvoCUA-32B干脆几乎不用命令行使用率只有0.15%等于形同虚设。这说明了一个很关键的事实**不是给AI一把新工具它就自动会用。**如果不搞清楚这一点会怎样会出现手里拿着螺丝刀却还在用扳手拧螺丝的尴尬场面。这些AI模型虽然理论上能访问命令行但它们脑子里根本没有这个任务应该用命令行来做这根弦也不知道命令怎么写才对结果就是命令行成了摆设甚至因为偶尔用错反而拖了后腿。瓶颈根本不在于有没有工具而在于知不知道什么时候用、怎么用。**给AI喂三种不同的训练素材**要让AI学会判断这活儿该用手还是该用嘴光靠现成的数据是不够的。论文里提到一个很现实的困境专门收集GUI操作的数据集里几乎全是点击拖拽收集命令行和代码的数据集又完全脱离了图形界面的上下文。这两类数据像两条永不相交的平行线谁也没法教会AI在真实的、图形化的电脑环境里恰当地切换到命令行。于是研究团队干了一件挺巧妙的事**他们发现很多GUI操作序列其实是能找到等价的命令行写法的。**这就好比你会发现用鼠标一步步把文件从A文件夹拖到B文件夹跟直接敲一行mv命令效果是完全等价的只是过程不同而已。既然如此为什么不把现成的GUI操作翻译成命令行操作呢基于这个思路他们搭建了一套数据生成流水线产出了三种类型的轨迹也就是AI完成一个任务的完整操作记录。第一种是纯GUI轨迹来自开源的UI-MOPD数据集把里面的每一步点击拖拽都改写成等价的PyAutoGUI代码一种可以用代码模拟鼠标键盘操作的Python库,塞进统一的操作格式里。第二种是纯CLI轨迹。研究人员先给每个应用比如LibreOffice、GIMP这些软件整理出一份专属的命令行技能手册列出这个软件有哪些命令行接口、常用命令是什么、典型用法长啥样。然后让一个叫Qwen3.8-27B的模型只用命令行去完成任务成功的记录就留下来。第三种是最关键的混合轨迹也就是GUI和CLI交替使用的操作记录。这里又分两条路一条是让模型同时拥有两种工具自己在执行过程中判断该用哪个另一条是把之前纯GUI轨迹里适合改写的片段直接转换成对应的命令行命令重新跑一遍只保留跑成功的版本。最终这套流水线产出了5000条轨迹加上3000个经过验证的强化学习任务合称HybridCUA-8K。值得一提的是这些轨迹不是随便攒出来的。论文里给出了详细的应用领域分布LibreOffice的三大件Impress、Writer、Calc各贡献了八百多条轨迹多应用协同的场景贡献了786条。平均每条轨迹有10.4个逻辑步骤,最长的能到50步。**训练分两步走先学着模仿再自己摸索**光有数据还不够怎么把这些数据喂给模型让它真正学会判断这是第二个技术难点。论文里设计了一套两阶段训练框架。第一阶段叫监督微调SFT说白了就是让模型照着已经验证过的正确操作轨迹去模仿学习。这一步教会模型两件事一是统一的操作格式怎么写二是在什么样的场景下切换接口是合理的。第二阶段是强化学习RLVR这一步更有意思。传统的强化学习通常只看最后任务有没有完成完成了就给奖励这种做法有个明显的漏洞。举个例子如果一个任务本来三步命令行就能搞定AI却绕了二十步GUI操作最后也蒙对了传统的奖励机制照样给满分因为它只认结果不认过程。反过来如果AI在命令行上敲错了一个命令只要最后瞎猫碰上死耗子把任务做完了这次出错也不会受到任何惩罚。**这种唯结果论的奖励方式根本没法教会AI什么时候该用命令行、命令又该怎么写才靠谱。**于是研究团队设计了两种CLI感知的奖励信号。第一种是任务级别的CLI奖励专门解决该不该用的问题。他们给3000个验证任务都打上了标签标明这个任务用命令行是不是有明显优势这个标签是怎么来的呢对每个任务分别用纯GUI、纯CLI、混合三种方式各跑16次比较成功率和步数选出表现最好的方式作为标准答案。如果AI跑出来的轨迹选择的接口跟标准答案对上了而且任务也做成功了就给额外奖励选错了接口哪怕蒙对了结果也拿不到这份奖励。第二种是步骤级别的执行奖励专门解决怎么用的问题。每当AI执行的命令行命令报错了这一步就会受到惩罚不管最终任务有没有完成。这就像老师批改作业不只是看最后的分数对不对还要检查你解题过程中每一步的公式写得规不规范。这个设计思路其实很像教小孩子学做家务。你不能只是在孩子把碗洗干净后夸一句真棒你还得告诉他用洗碗机洗一大摞碗比手洗快但洗那个祖传的手绘瓷碗最好还是手洗别图省事扔进机器里洗坏了。如果只奖励碗洗干净了这个结果孩子永远学不会判断什么时候该用什么方法甚至可能因为某次手洗恰好蒙对了结果而对该用洗碗机的场景也继续手洗。**训练出来的模型到底强在哪**说了这么多设计思路最后还是得看数据说话。研究团队用Qwen3.5-9B作为基础模型经过前面说的两阶段训练得到了最终的HybridCUA-9B。先看最重要的对比只用GUI跟GUI加CLI混合效果差多少。基础模型Qwen3.5-9B在纯GUI模式下的准确率是38.8%平均要走31.6步。有意思的是如果只是简单粗暴地给这个基础模型加上命令行访问权限不经过任何训练准确率反而暴跌到18.4%印证了前面说的瞎给工具反而更差的现象。但是经过完整的两阶段训练之后HybridCUA-9B的准确率飙升到53.6%平均步数也压缩到了14.0步。这意味着相比训练前的基础模型准确率提升了整整14.8个百分点任务完成所需的步数几乎减半。拿这个成绩去跟同规模的其他模型比一比。|模型|接口类型|准确率|平均步数||---|---|---|---||Qwen3.5-27B|GUI|51.4%|25.7||EvoCUA-32B|GUI|56.7%|25.0||ToolCUA-8B|GUIAPI|46.8%|14.9||AutoGLM-OS-9B|GUIAPI|48.9%|-||UltraCUA-32B|GUIAPI|43.7%|-||**HybridCUA-9B**|**GUICLI**|**53.6%**|**14.0**|值得注意的是HybridCUA-9B在参数量只有9B的情况下超过了参数量四倍于它的UltraCUA-32B将近10个百分点还比同样走GUI加专用API路线的ToolCUA-8B高出近7个百分点而且步数更少。**这也印证了论文最初的判断命令行这条路比给每个软件单独开发专用接口的路子更划算。**再来看一个很能说明问题的细节。前面提过现成的模型即便有命令行也不太会用比如EvoCUA-32B的命令行使用率只有0.15%。而HybridCUA-9B训练完之后命令行使用率达到了64%跟测试的模型里使用率最高的Claude-Opus5基本持平67%。但奇怪的是Claude-Opus5虽然也大量用命令行准确率却反而比它的纯GUI版本低了6.6个百分点。这说明了一件事**光是多用命令行不等于用得好关键是知道该在哪些场景下用。**这就好比两个人都爱用计算器算账一个人是心算能力不行什么都依赖计算器结果反而因为按错键出错更多另一个人是清楚哪些复杂计算该用计算器、哪些心算更快更准用得恰到好处。数量一样不代表质量一样。**AI是怎么分配任务的**论文里还做了一些很有意思的分析看看训练好的HybridCUA-9B到底是怎么判断该用GUI还是CLI的。结果显示它的选择是有章法的跟具体的应用场景和操作类型紧密相关。比如在操作系统相关的任务里涉及文件、系统设置这类命令行的使用率高达84%因为这类任务本来就是命令行的强项直接读写文件比在图形界面里翻箱倒柜快得多。而在浏览器相关的任务里图形界面的使用率反而达到74%毕竟网页内容主要靠看命令行很难替代视觉交互。按操作类型细分也很有意思。内容编辑类操作有85.8%用了命令行结果验证类操作更是高达98.4%都用命令行因为这类任务本质上是直接的数据处理和状态检查用脚本一条命令读出来比在界面里一个个点开检查快多了。相反涉及空间位置调整的操作58.4%还是靠图形界面完成的因为这种把这个东西挪到那个位置的任务天然需要视觉反馈来判断对不对。论文里还举了一个具体的例子很能说明两种接口是怎么配合的。任务是给一篇作文的引言、正文、结论三个部分分别设置单倍行距、双倍行距和1.5倍行距字号统一改成12号。AI的操作是这样的先用图形界面点击打开文档窗口和菜单这一步必须靠看然后切换到命令行用python-docx这个库批量处理格式和行距一次性把三个段落都改完并保存文件。到了验证环节更有意思AI先用图形界面操作把菜单关掉紧接着在同一个命令行动作里重新打开保存好的文件检查字号和行距设置是否正确两个动作打包在一条命令里执行。这个例子特别能体现混合的真正含义,不是简单地把GUI步骤和CLI步骤拼接起来而是让两者在同一个任务里各自发挥所长,该看的时候看该批量处理的时候批量处理甚至在一步操作里就能把两种动作揉合在一起。**跨平台会不会也好使**一个方法如果只能在特定场景下管用价值就要打折扣了。研究团队专门测试了HybridCUA-9B在两个陌生环境里的表现,看看它学到的这套接口选择能力能不能迁移。第一个测试场景是OSWorld-MCP这是在OSWorld任务基础上加了MCP工具支持的环境。MCP全称Model Context Protocol一种让AI模型可以调用外部工具和服务的标准化协议。结果HybridCUA-9B拿到了47.1%的准确率比同样规模的Qwen3.5-9B高出9.1个百分点跟专门做GUI-API集成的ToolCUA-8B基本打平。这说明训练时学到的什么时候该用命令行这套判断逻辑即便换到一个带着全新工具生态的环境里,依然管用。第二个测试场景更极端,直接换操作系统,跑到WindowsAgentArena一个专门评测多模态智能体在Windows系统上表现的基准上试试。要知道HybridCUA-9B训练的时候用的全是Linux环境的shell命令,Windows系统底层用的是完全不同的命令语法PowerShell。结果它在WindowsAgentArena上拿到了36.0%的成绩比基础模型高出4个百分点比ToolCUA-8B也高出2.2个百分点。更让人意外的是论文里提到它甚至能自主写出PowerShell命令,虽然训练过程中它压根没见过一条PowerShell命令。这个结果其实挺发人深省的。**它说明模型真正学到的不是死记硬背某个操作系统的具体命令语法而是一种更底层的判断能力知道什么时候该把活儿交给命令行去干。**这就好比一个厨师如果只是背下了某个菜谱的具体步骤换一家厨房、换一套厨具他可能就懵了但如果他理解的是炖肉需要小火慢煮、爆炒需要大火快炒这套底层逻辑那换到哪个厨房他都能照样掌勺。**这套方法还有没有讲究**论文里还做了几组对照实验专门验证每个设计细节是不是真的有必要这些细节挺值得说道说道的。第一组实验测的是训练数据的搭配比例。如果只用纯GUI数据训练准确率是43.2%只用纯CLI数据训练反而跌到31.7%只用混合轨迹训练是41.0%。而把三种数据混在一起训练准确率达到46.0%比单独用任何一种数据都要好。这说明三种类型的数据教给模型的是不同的能力缺一不可互相之间是互补而非替代的关系。第二组实验拆解了强化学习阶段两种奖励信号各自的作用。如果去掉专门判断该不该用CLI的任务级奖励模型的准确率影响不大但命令行使用率只能达到58.9%相比完整版的64%效率提升也打了折扣步数只缩短了18.2%完整版能缩短29.3%。反过来如果去掉专门盯着命令执行对不对的步骤级奖励准确率和步数看起来影响也不大但命令行的执行错误率会慢慢回升到16.5%甚至比训练前的基础模型还要差。**这两组数据放在一起看说明这两种奖励信号各管一段一个负责教会模型什么时候伸手去够命令行另一个负责教会模型伸手之后怎么把命令写对两者缺了任何一个都会留下明显的短板。**第三组实验测的是动作格式的设计。研究团队对比了两种做法一种是把GUI和CLI分别做成两个独立的工具接口让AI自己判断调用哪个另一种是这篇论文采用的统一方案把两种操作都塞进同一个叫bash的动作接口里。结果统一格式的准确率是46.0%分离格式的准确率是38.8%整整低了7.2个百分点。这说明把两种接口硬生生拆开反而会增加模型的认知负担融合成一套统一语法反而更容易学会灵活切换。QAQ1HybridCUA是什么AHybridCUA是一套让AI电脑助手学会同时使用图形界面操作和命令行操作的训练框架核心思路是让AI既能像人一样点击鼠标也能在合适的时候用一条命令代替几十次点击从而提升任务完成的准确率和效率。Q2为什么直接给AI开放命令行权限反而会让效果变差A因为现有的AI模型没有经过专门训练不知道什么时候该用命令行、命令又该怎么写才对实验显示四个代表性模型加了命令行权限后准确率反而下滑了2.5到11.5个百分点说明问题不在于有没有工具而在于会不会用。Q3HybridCUA-9B的实际表现如何A在OSWorld基准测试上准确率达到53.6%比基础模型提升14.8个百分点平均操作步数也从31.6步降到14.0步还在跨系统的WindowsAgentArena测试中取得36.0%的成绩展现出较强的跨平台迁移能力。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进