网易首页 > 网易号 > 正文 申请入驻

别让米其林主厨削土豆!英伟达用「小脑指挥大脑」,重构AGI生产力

0
分享至

新智元报道

编辑:peter东

【新智元导读】觉得大模型消耗的算力过大,英伟达推出的8B模型Orchestrator化身「拼好模」,通过组合工具降本增效,使用30%的预算,在HLE上拿下37.1%的成绩。

最近,NVIDIA Research发现,只要经过适当微调,小模型已足以「指挥」大模型

英伟达研究团队的新模型Orchestrator仅有 80 亿参数(8B)的模型,不仅比以往的工具使用类AI智能体准确率更高、成本更低,还能在工具选择上精准对齐用户的偏好。

在HLE基准测试中,Orchestrator斩获了37.1%的高分,一举超越了GPT-5(35.1%),同时在效率上提升了2.5倍。

在tau2-Bench和FRAMES测试中,Orchestrator同样以大幅优势领先 GPT-5,而其成本仅为后者的30%左右。

在多项指标上,Orchestrator均实现了性能与成本的最佳平衡,并能出色地泛化至未曾见过的工具中。

预印本链接:https://arxiv.org/abs/2511.21689

为什么「强模型+工具」还是不够好?

面对Humanity’s Last Exam(HLE)这类超难综合推理考试,现在的大模型虽然「什么都懂一点」,但一到深度推理+控制成本就开始吃力。

只靠一个大模型(比如GPT-5)去调用搜索、代码解释器这些基础工具,很难同时做到:够准、够便宜、够可控。

为了省钱,业界第一反应是:别什么都让最强模型上,搞个「调度者」来分配任务。

但真把主流大模型拉来做调度者,结果却很讽刺:

  • 当GPT-5做调度时,98%的请求还是落回GPT-5或GPT-5-mini;

  • 换成Qwen3-8B,当它拿不准时,73%的任务直接无脑丢给GPT-5。

换句话说:我们以为造了个「调度者」,结果只是多请了一个「转接电话的前台」。

使用不同模型作为调度者后,给不同模型分配的任务

结果说明,仅仅通过提示词,无法让常见的大模型变成合格的调度者。

而ToolOrchestra,通过将「智能」从单一模型中解耦,重构为「轻量调度中枢+异构能力工具集」的复合系统,构成了一种全新的模型与工具协同范式。

接下来,看看Orchestrator是怎么训练出来的。

Orchestrator:多轮执行与自定义RL

想象一下:过去的大模型,都像高端餐厅,全靠「米其林主厨」(GPT-5)从头到尾亲自炒菜——火候、刀工、摆盘,全靠一人。

结果呢?由于单个token成本很高,导致总成本直接原地起飞。

而英伟达新推出的「拼好饭」模式如同中央厨房,一个聪明的「调度店长」(8B小模型Orchestrator)驻守中央,店长不亲自炒菜,而是:

  • 让街角「川菜小馆」(Qwen-Math-7B)爆炒回锅肉(数学题);

  • 招「粤式点心师傅」(Coder-32B)蒸一笼虾饺(写代码);

  • 实在拿不准?叫米其林主厨(GPT-5)来尝一口、定个味。

Orchestrator的架构图

其中用于调度的8B小模型Orchestrator,会通过强化学习,根据用户声明的倾向,系统自动倾向本地部署模型。

而训练过程中的奖励函数,可分为3部分:

1. 结果,即是否答对,答对+1,否则0;由GPT5给出判断;

2. 效率,对应金钱成本和时间延迟;

3. 对齐用户工具偏好向量。

三部分加起来,才是强化学习的目标函数,而最终训练得到会权衡、听指挥、懂省钱的Orchestrator。

Orchestrator还包含类人分步求解机制:

  • 可通过COT思维链,Orchestrator分析当前状态,规划下一步的结构化工具调用;

  • 之后,通过环境执行(如数学推导、代码执行输出)并返回结果;

  • 如此多轮循环,则是Orchestrator的另一创新点。

有了训练方法,该研究还构建ToolScale来支撑强化学习的训练。

作为首个大规模、可验证的多轮工具调用合成数据集:ToolScale通过大模型自动构建10个领域(金融、医疗、航空等)的模拟环境(含数据库+工具API),再生成43万条含人工标记的最佳工具调用轨迹的任务。

ToolScale数据合成流程概览

每条任务需满足三重验证:

  • 执行正确性(数据库状态变更一致)

  • 过程保真度(关键信息被提及)

  • 操作完备性。

这些数据被用来训练Orchestrator。

AGI的「务实主义革命」

在三大高难度基准上,Orchestrator-8B全面超越现有方法且显著降低推理成本:

  • 在HLE(人类终极考试)取得37.1%准确率(vs.GPT-5的35.1%),成本仅9.2美分(为GPT-5的30%);

  • 在τ2-Bench(函数调用严测)上有80.2%正确率,仅有约40%的步骤调用GPT-5;

  • 而在FRAMES(事实性推理)得分76.3%(vs.SOTA74.2%),延迟降至8.2分钟(为GPT-5的41%)。

Orchestrator调度后的模型性能和成本对比。

相较于强大的单体大语言模型系统,Orchestrator实现了最佳的成本效益:

进一步分析揭示其卓越性能源于理性分工能力:

  • Orchestrator会按需调用本地检索、Math-7B、Qwen-32B等低成本工具,仅在关键步调用GPT-5(1.95次/题);

  • 若是GPT-5进行调度,那么解决一道题目需要平均调用5.23次GPT05-mini。

调用低成本的模型去解决不那么复杂的问题,正是Orchestrator能够降本增效的根源。

Orchestrator调用不同工具的比例对比

Orchestrator还展现出极强泛化性:面对训练未见模型(如Gemma-3-27B、Codestral-22B)或新定价策略(DeepInfra),其性能仅轻微波动,证明其学会的是工具能力抽象与成本-效益权衡的通用策略,而非过拟合特定配置。

同时在满足用户偏好时,Orchestrator的表现也优于其它大模型,这证明Orchestrator具有可定制、可约束、可解释的工具调度能力。

复合AI第一步

这几年,AI 世界一直在讲同一个故事:先造出一个尽可能大的通用大脑,再通过提示词和少量样本,把它临时「装扮」成翻译、写作、编程等各种专家。

但随着研究不断推进,这个故事开始松动:

越来越多由多个模型和工具协同工作的「复合AI系统」,在安全性、速度和成本上都比单一大模型更有优势,甚至在能力上也实现赶超。

总结来看,面对大模型使用后的高成本,高能耗问题,Orchestrator展现了通过将「决策权」与「执行权」分离,不再指望一个超人拯救世界,完全可开辟一条通往高效、可控、可扩展的实用化AGI系统的新路径。

ToolOrchestra标志着我们朝着构建真正智能的复合AI系统迈出了第一步,这代表着一种正在兴起、旨在取代单一化AI架构的新范式。

小语言模型终将成为实现可扩展智能体AI的关键核心。

参考资料:

https://arxiv.org/abs/2511.21689

https://developer.nvidia.com/blog/train-small-orchestration-agents-to-solve-big-problems/

https://research.nvidia.com/labs/lpr/ToolOrchestra/

秒追ASI

⭐点赞、转发、在看一键三连⭐

点亮星标,锁定新智元极速推送!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
太危险!小孩拿比亚迪1000V闪充枪荡秋千 家长千万看住

太危险!小孩拿比亚迪1000V闪充枪荡秋千 家长千万看住

快科技
2026-10-04 14:49:05
CCTV16直播,国足荣誉之战,邵佳一别玩对攻,韦世豪+王上源压阵

CCTV16直播,国足荣誉之战,邵佳一别玩对攻,韦世豪+王上源压阵

替补席看球
2026-10-05 13:56:30
中国大满贯:日乒再被打脸,4大主力一轮游,亚运被国乒打出阴影

中国大满贯:日乒再被打脸,4大主力一轮游,亚运被国乒打出阴影

无月可归辛
2026-10-04 21:47:37
乌克兰人非常不解,俄军几乎天天都在炸基辅,为何不炸泽连斯基?

乌克兰人非常不解,俄军几乎天天都在炸基辅,为何不炸泽连斯基?

荷兰豆爱健康
2026-10-05 01:16:01
孙千惊艳时装周被喊,Luke2.0,全网找Luke,井柏然却在家晒素颜照

孙千惊艳时装周被喊,Luke2.0,全网找Luke,井柏然却在家晒素颜照

悦君兮君不知
2026-10-04 16:15:44
45岁小沈阳到底多有钱?豪车豪宅只是表面,这几年三笔投入更惊人

45岁小沈阳到底多有钱?豪车豪宅只是表面,这几年三笔投入更惊人

动物奇奇怪怪
2026-10-05 14:31:51
百年无解历史难题:为何百万大军无人割据?毛主席的智慧全是人性

百年无解历史难题:为何百万大军无人割据?毛主席的智慧全是人性

听雪禅
2026-10-05 16:40:07
常香玉、秦怡、郭兰英都走了,中国四大人民艺术家,只有她还活着

常香玉、秦怡、郭兰英都走了,中国四大人民艺术家,只有她还活着

兵卒史
2026-08-14 12:32:28
王励勤没料到,中国大满贯刚开幕,惹出新争议,五大主力齐退赛

王励勤没料到,中国大满贯刚开幕,惹出新争议,五大主力齐退赛

寒士之言本尊
2026-10-05 17:49:33
10-5!22岁吴宜泽成3冠王,排名升至世界第2,反超赵心童条件出炉

10-5!22岁吴宜泽成3冠王,排名升至世界第2,反超赵心童条件出炉

小火箭爱体育
2026-10-04 23:25:17
国家出手!蔡天凤案迎来收尾:开水煮、电锯切、手法令人毛骨悚然

国家出手!蔡天凤案迎来收尾:开水煮、电锯切、手法令人毛骨悚然

尺素a
2026-10-04 20:04:32
德国金发女当街怒吼中东难民:不融入就滚,凭啥改我们的规矩?

德国金发女当街怒吼中东难民:不融入就滚,凭啥改我们的规矩?

步论天下事
2026-09-30 10:10:18
领先84分,还剩7站:F1冠军悬念正在被一个人杀死

领先84分,还剩7站:F1冠军悬念正在被一个人杀死

竞技风云录
2026-10-04 18:55:43
为什么必须尽快统一台湾?四大核心原因,越拖代价越大

为什么必须尽快统一台湾?四大核心原因,越拖代价越大

世界有奇事
2026-09-29 09:21:55
太憋屈!5块金牌,5张非洲脸:谁在羞辱亚洲体育?

太憋屈!5块金牌,5张非洲脸:谁在羞辱亚洲体育?

荆楚寰宇文枢
2026-09-30 22:26:52
2026年出生人口预测:老百姓对断绝香火危机的冷漠,官方看到都无奈

2026年出生人口预测:老百姓对断绝香火危机的冷漠,官方看到都无奈

非虚构人间
2026-09-11 01:40:57
年薪百万是一种什么感觉?网友:其实阿姨过的才是我想要的人生!

年薪百万是一种什么感觉?网友:其实阿姨过的才是我想要的人生!

另子维爱读史
2026-10-04 21:20:22
南宁骑行圈风波尘埃落定!梁女士退婚失业,鸟哥销号隐身,一时冲动突破底线,结局只能自食苦果

南宁骑行圈风波尘埃落定!梁女士退婚失业,鸟哥销号隐身,一时冲动突破底线,结局只能自食苦果

火山詩话
2026-10-03 11:29:58
颠覆认知!糖尿病不吃药也能逆转?《柳叶刀》:关键是……

颠覆认知!糖尿病不吃药也能逆转?《柳叶刀》:关键是……

徐德文科学频道
2026-10-03 12:10:08
这国不装了,公开支持“南海仲裁法”,中方强硬回应,信号不简单

这国不装了,公开支持“南海仲裁法”,中方强硬回应,信号不简单

史智文道
2026-10-04 16:29:46
2026-10-05 18:48:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16353文章数 67121关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

明珍珍被执行死刑前画面披露 接受采访神情淡定露微笑

头条要闻

明珍珍被执行死刑前画面披露 接受采访神情淡定露微笑

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永事件发酵!品牌火速切割

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

艺术
数码
手机
时尚
公开课

艺术要闻

王羲之唐拓《金刚经》出土,5100多字没有任何缺损,能看一眼都是福气!

数码要闻

狠!三星 HBM 内存直接涨价 3 倍,网友急问:芯片、手机都要涨价吗?

手机要闻

苹果终极旗舰 iPhone20 Pro Max 彻底曝光!四曲面全玻璃 + 屏下相机

Christian Louboutin的魅力,不止一双红底鞋

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版