![]()
Token 砍半,活没少干,每小时还省13.5刀!
作者丨高允毅
编辑丨岑 峰
最适合鞭打AI干活,还得是 AI 啊。
英伟达今早开源了一套提高工作效率的 Harness ——SoL-Pi,它让AI亲自当监工,去Agent工作流中吹毛求疵,把每一处可能“摸鱼、浪费Token”的环节进行修复,自我迭代优化。
效率提升后,Token消耗最高减少了 64%,API 调用成本下降 50%–54%,在实际开发中每小时能帮企业省下 8.75 到 13.5 美元。
它之所以能有这么好的效果,是因为英伟达让 AI 提出了 152 个优化工作流的想法,通过严苛的自动化流水线层层淘汰,最终只有 4 个机制活了下来。这4个机制就成为了SoL-Pi的核心。
因为它是基于开源项目 Pi 改造的,所以名字里也带上了这个关键词。
现在大家都在想办法降本增效,英伟达的这次创新,实实在在为企业省了不少钱。
01
AI怎么发现AI偷懒的?
AI是怎么找到AI偷懒的?这件事要从两个层面讲,一个是眼前的浪费,一个是长远的困境。
在真实业务中,现在AI的工作早已进化成成千上百个Agent协作,干个几天几夜,都不需要人插手了。不过,这也意味着,如此长的周期,上下文堆积的历史记录会越来越臃肿,调用的工具也越来越多。
每次调用模型,都要把这些历史内容重新读一遍,必然藏着巨大的冗余。而且 AI 缺乏人类的变通能力,有时候很多可以连续完成的操作,它可能就会死板的拆成两次决策。这些零散的浪费积累起来,烧掉的都是真金白银。
目前行业都在聊RSI,即AI自己优化自己,但每一次尝试都是要消耗Token的,而且 90% 以上的尝试最终都会失败。这种盲目试错的成本太高了,企业可能还没等到 AI 进化成功,资金链就先断裂了。
那英伟达的思路是,效率我要提升,但钱我也要省。他们没有让 AI 盲目地在线去改代码,先让 AI 批量提出 152 个优化工作流程的想法,然后放进一个严苛的自动化沙盒里进行筛选。这个自动筛选的过程,被称为“自动研究循环”。
英伟达还探索了3种AI管理AI的方式。
一个是计划经济模式,即你是老板,我照做。由人或者主模型定死每一个步骤,但很快因为死板的规则被放弃。
第二是中心化管理模式,即有一个超级主管 AI,在运行时现场写代码、开会、给底下的 Agent 派发任务、实时调整流程。这种模式非常灵活,但会累死主管,主模型核心代码库变得无比庞大臃肿。
第三个是共享快闪模式,整个系统只维护一个最简化的“工作模板”和说明书。每个 AI 实验启动时,直接复制一份这个模板,在里面随心所欲地改代码、跑实验。一旦这个实验结束,这套临时改出来的指挥代码就被直接丢弃。
第三个方案被采用,跑完了 152 个实验。最终,只有 4 个最有效的机制活了下来,成为了 SoL-Pi 的核心骨架。
▎机制1:动作融合
之前AI 改完一行代码,要先停下来思考一次“接下来我要不要跑个测试验证一下?”,做出决定后,再发指令调用终端跑测试,这中间多了一次 AI 推理。
系统识别后,直接把“改代码 + 跑测试”这种固定的连续动作,两步并做一步,省掉那次多余的决策开销。
![]()
▎机制2:在线上下文压缩
Transformer的机制,决定了AI的记忆,是线性累加的,每做完一个任务,都要把前面的积累“上下文”都看一遍,这样成本会越拉越高。
优化后,系统会把大任务拆分成一个个独立的小任务,每做完一个小任务,就把这段历史压缩整理成精简版,只保留关键结论。平常只开“摘要”,需要核对细节了,再把原始记录调取出来。
![]()
▎机制3:观察包
每次工具输出的结果,也会完整地塞进上下文里,比如跑测试生成的几百行日志。后面每次讨论到这个结果,都要带着这一大段内容,非常占用空间。
优化后,系统会把完整的输出结果存在本地,上下文里只留一个简短的“摘要 + 索引”,AI 如果想看具体详情,再专门调取对应段落即可。
![]()
▎机制 4:证据保存型简化器
在分析错误日志、排查问题时,都需要主模型从头读到尾,这有点“杀鸡焉用牛刀”。
优化后,系统会用成本更低的小模型把日志提炼成“诊断报告”,而这份报告的每一个结论,都能对应回原文的具体位置。主模型只看这份精简报告,如果有疑问,再去核对原始原文。
![]()
02
比 Pi 更省钱的 Harness,
将大模型性价比推向极限
为了验证这4个机制效果如何,英伟达搭出535个可验证环境。
其中,495 个任务是英伟达团队去 GitHub 上翻找了 真实的开源项目 bug,它们把代码仓库“一键还原”到当年程序员还没修这个 Bug 时的历史状态,并在离线环境里装好依赖。同时,把当年人类程序员是怎么修好这个 Bug 的“正确答案”藏起来不让 AI 看到。
另外40个任务是“盲盒通关题”,英伟达先用代码写好一个“验证器,然后把 AI 丢进一个开放式的沙盒里,没有剧本,全靠 AI 自由探索去触发这个通关条件。
然后让 4 种Harness同台竞赛,分别是用原生框架驱动的GPT-5.6 Sol、Claude Opus 5、开源智能体底座 Pi 以及英伟达自己的 SoL-Pi 。
结果,SoL-Pi 在保住基本盘情况下,展现出了惊人的省钱效率。
![]()
对比 Pi, SoL-Pi 消耗的 Token 减少了 45%–49%,开发成本直接砍掉约三分之一。
对比模型原生的官方代理框架,SoL-Pi 的 Token 消耗最高骤降 64%, API 价格最多降了54%
![]()
![]()
经过这场实验后,英伟达得出了自己的结论:效率本身也是一种RSI。
与其一味追求让AI更聪明,不如先让AI干活更有效率。这样省下来的预算可以用来跑更多实验,尝试更多想法,最终反过来加速 AI 能力的泛化和进步。论文里把这个叫“Efficiency for efficiency”——效率既是结果,也是下一轮研究的资源。
而真正的效率并不是刷题来的,这四个机制,本质上都是挖出了 AI 工作流中普遍存在的“通病”。哪怕你换了模型、换了任务,这些通病依然存在。
而这四个想法之所以能诞生,全靠广撒网、多尝试,如果只盯着一个方向深挖,很容易钻进死胡同。在这个阶段,“广度比深度更重要”。
以后这种“AI 改进 AI 工具”的事情会越来越多,哪怕你不用 SoL-Pi 这个工具,这四个优化思维也可以直接套用到你自己的 AI 工作流里了。
参考链接:https://nvlabs.github.io/SoL-Pi/
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.