网易首页 > 网易号 > 正文 申请入驻

阿莫迪偷师姚顺雨,奥特曼偷师梁文锋

0
分享至

来源|字母AI

正所谓天下文章一大抄,看你会抄不会抄。

刚刚发布的Opus 5.5和GPT-6 Luna,一眼望去,这两个模型上面满满是姚顺雨和梁文锋的影子。

或许是因为两家公司都已经将预训练做到了极致,为了提升模型的智能以及降低算力成本,所以这两个新模型都选择开辟新的战场。

Opus 5.5是对上下文动手,GPT-6 Luna是对缓存动手。

这我可熟啊!一个混元,一个DeepSeek啊!

但你别说,阿莫迪和奥特曼还真抄得挺像那么回事。

01

阿莫迪偷师姚顺雨

先看一组数字,Artificial Analysis的智能指数里,有一项统计是“跑完一道题平均要输出多少token”。

在这张榜单上,Claude Opus 5.5在max档位下,平均每题要吐出11.9万个输出token,其中8.4万个是“思考”,3.5万个是最终答案。而OpenAI的GPT-6 Astra,在同一档位下只用了2.7万个 token。

大模型想要提升模型的智能水平,传统路线是在预训练阶段堆数据、堆算力,把智力放进模型的权重里,一次训练、反复使用。

这条路线的模型在推理时几乎不做额外思考。模型训练时数据价值越高,模型的智能水平就越高。

但传统路线就怕出现没见过的题型,传统模型的泛化是插值。在训练数据覆盖的分布附近,它表现很好。一旦碰到没见过的题型,或者需要多步推理的题,它就开始瞎编。因为它的“智力”全在权重里,权重没见过的模式,它推理时也补不出来。

就像你对着木桩练了很久的拳法,结果发现上了战场以后,对方不会站着不动,而且还会使用武器。

另一条是test-time路线。训练完的模型只是个半成品,真正答题时,先让它写一大段推理,想得越久、答得越好。智力不再只来自权重,还来自于每次调用时现场的推理。

换句话说,智力被搬进了上下文。

Opus 5.5走的就是test-time路线。


官方有这么一条声明:除非特别注明,所有成绩都跑在“adaptive thinking at max effort”(最大力度的自适应思考)下。

而且从这一代开始,Opus 5.5不再提供“关闭thinking模式”的选项。变相就是在说,推理过程就是模型的一部分。

代价就是思考过程会消耗更多token,成本也会随任务难度飙升。Opus 5.5的核心逻辑是,该训练的数据都训练得差不多了,预训练边际收益见顶,因此智能的增量只能从推理里找。

这种从上下文中找智能的逻辑,姚顺雨很早就提出来过。

2023年,姚顺雨提出Tree of Thoughts(思维树)这个概念,其本质就是一种test-time。

推理时展开多条思路,边想边搜索最优解。

同一年,他还提出了ReAct架构,让模型“推理”和“行动”交替进行。

2025年4月,姚顺雨发表博客《The Second Half》。

文章的核心判断是,AI的上半场,拼的是“训练方法与模型”,比如更大的参数、更多的数据、更强的算力。到了下半场,拼的是“如何使用与评估模型”,增量正在从“训练”挪到“推理与行动”。

他在文中写到,“把推理放进动作空间之后,我们才获得了‘针对不同决策灵活分配test-time compute(推理时算力)’”的能力。

姚顺雨把“思考”称作一种“奇怪的动作”。

RL里的动作是用来改变环境的,比如打开一个箱子,那么箱子的状态就会发生改变。动作的意义,就在于“让世界发生变化,从而换来奖励”。

但思考不会,即使想了一万遍,箱子也不会自己打开。

姚顺雨在文章中举了个例子,说有两个盒子,一个有100万美元、一个空的,这时候,期望收益就是50万。

现在往里塞进无数个空盒子,期望收益就会越来越低,因为要从无穷多个盒子里挑那个100万美元的盒子。

然而,如果把“推理”这个动作加进去之后,模型反而更强了,会更容易选中那个100万美元的盒子。

姚顺雨的解释是,那些“空盒子”,你在生活里以及各种游戏里都见过。挑选它们的过程本身,就是在为“选中那个装钱的盒子”做准备。

Opus 5.5,就是把姚顺雨的这个理念给工程实现了。

02

奥特曼偷师梁文锋

如果说Opus 5.5的重点是“怎么想”,那GPT-6 Luna的重点就是“怎么便宜地想”。

GPT-6 Luna输入0.1美元/百万token、输出0.5美元/百万token,比上一代GPT-5.6 Luna直接砍半。

如果缓存命中,那么读一次缓存的价格是0.01美元/百万token,比标准输入价便宜90%。

模型的每一次调用,都要把你给它的全部上下文“读一遍”。比如系统提示、长文档、历史对话,一个字都不能少。

但是这段上下文,重复度极高。Agent每多走一步,前面那一大坨都要重读一遍。长上下文,就成了烧钱的黑洞。

GPT-6 Luna使用的缓存复用(prompt caching/KV cache复用),它所要解决的就是这件事。同一段上下文,算过一次就存起来,下次直接“读缓存”、不重算。于是“重复的那部分”,从最贵变成了最便宜。

但这套动作,DeepSeek早就做过了。

2026年8月2日,DeepSeek上线“Context Caching on Disk”(磁盘上下文缓存),把重复内容缓存在磁盘阵列上,命中时直接取用、跳过重算。

当时公告写着,缓存命中价砍到0.1元/百万token,比未命中便宜正好也是90%,和GPT-6 Luna一样。

到了V4 Flash这里,命中0.02元、未命中1元,差50倍。

GPU显存非常贵,所以能存的KV cache容量有限。但是硬盘很便宜,并且容量大,将KV cache存进去以后成本会大大降低。

OpenAI现在做的prompt caching和DeepSeek原理几乎相同,同一段前缀算过一次存起来,下次直接读。


不止价格,还有架构。

GPT-6 Luna的上下文窗口是105万token,DeepSeek V4是100万token,两边几乎对齐。

但是,100万上下文的KV cache,按标准注意力机制来算,一半的模型根本扛不住。

为此,DeepSeek使用了MLA架构,把Key和Value联合压缩进一个低维潜空间,缓存那个潜向量、用时再上采样还原。

DeepSeek-V2的技术报告里提到,MLA把KV cache砍掉了93.3%,生成吞吐提升到5.76倍。到了V4,又叠上压缩稀疏注意力和重度压缩注意力,V4-Pro在百万token上下文下,KV cache只有上一代V3.2的10%。

除此以外,OpenAI还“偷师”了一招:推测解码。

OpenAI在官方博客里说,他们跑一个更小的draft(草稿)模型,让它和主模型并行地“猜”接下来几个 token,主模型再批量验收。

猜对了,一次前向就能吐好几个token。OpenAI官方表示,这一项改进让token生成效率提升了15%以上。

这个思路在2024年的DeepSeek V3里就有了,DeepSeek使用的是MTP(Multi-Token Prediction,多token预测)。

其做法是在主干模型后面直接挂一个MTP头,训练时和主干一起训,共享主干的hidden state。推理时这个头知道主模型内部状态长什么样,猜得准、验收通过率高。

这个头可以直接丢掉不影响主干,也可以留着当草稿机。

OpenAI相当于是外挂了一个独立的小模型去打草稿。两个模型各跑各的,草稿不知道主模型在想什么,只是猜完由主模型验收。

虽然方法不太一样,但是两者的思想是同一个。小的先猜、大的批量验,把串行解码变并行。

03

天下文章一大抄

以前,定义模型的是硅谷,国内AI公司因为算力有限,所以会把这些定义转换成更便宜的解决办法。

这一轮,反过来了。学术范式和工程范式,都是中国公司做的。

美国的巨头们则负责最后一步,把它做成产品,卖给全世界。

过去几年,大厂的资源、人才、注意力全部all in在预训练这个主战场上。

大家根据Scaling Law来堆数据、堆算力、刷榜单。可头部公司都陷入了前文提到的,Anthropic如今的窘境,优质数据几乎全部训练完成,模型预训练边际收益递减。

那么这时,行业的增量自然而然就会出现在第二战场,比如推理时怎么想(test-time compute)、上下文怎么用(context learning)、长上下文怎么便宜(caching/MLA/稀疏注意力)。

这就好比武林里,大门派花了几十年练一门功夫。练着练着就发现,武功练到一定程度就不涨了,反而以前那些不起眼的“旁门左道”更能提高功力。


这里还有个反直觉的地方,主战场上的优势,到了第二战场,反而成了“累赘”。

手里攥着最多算力和数据的一方,恰恰最没动力去抠成本、抠效率。头部公司已经形成了“反正我堆卡就能解决问题,何必费劲去想更聪明的办法?”的想法。这就导致省显存、省钱这件事,从一开始就不是他们的议题,甚至有点“掉价”。

只有算力吃紧的一方,才会把每一分钱都花在刀刃上。

DeepSeek的MLA、磁盘缓存、稀疏注意力,本质上都是“穷则思变”。

当年它们只是“没钱的替代方案”,是没办法的办法。可真到全行业开始拼效率的时候,这些“土办法”忽然成了最硬的通货。

于是才会出现国外“偷师”国内的现状。

生成式AI入侵,被喂食“泔水”的人开始抵抗

重磅揭晓!2026凤凰之星上市公司评选正式颁出。

作为凤凰湾区财经论坛2026核心环节,本届评选紧跟人工智能浪潮全面升级,新增两大AI主题大奖,多维度硬核遴选,29家标杆企业脱颖而出,解码中国上市公司高质量发展全新动能,以下为获奖名单:


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
国际油价9月25日下跌

国际油价9月25日下跌

极目新闻
2026-09-26 09:00:23
日本亚组委事务总长就住宿、交通等方面问题道歉:我认为大家应该都能够感受到现在的住宿、交通服务比一开始得到了明显改善

日本亚组委事务总长就住宿、交通等方面问题道歉:我认为大家应该都能够感受到现在的住宿、交通服务比一开始得到了明显改善

大风新闻
2026-09-26 15:03:14
中国最诡异的4家平台公司:所有风险留给穷人,所有暴利留给自己

中国最诡异的4家平台公司:所有风险留给穷人,所有暴利留给自己

白浅娱乐聊
2026-09-22 00:31:33
张雨霏妈妈独自撑了24年,丈夫车祸去世时女儿才4岁,6岁就让她自己倒公交去训练

张雨霏妈妈独自撑了24年,丈夫车祸去世时女儿才4岁,6岁就让她自己倒公交去训练

喜欢历史的阿繁
2026-09-26 14:59:25
内塔尼亚胡:5年内,追上中美

内塔尼亚胡:5年内,追上中美

环球时报国际
2026-09-24 07:55:13
离婚第二天,岳母花8万办酒席,前妻结账时服务员:银行卡已冻结

离婚第二天,岳母花8万办酒席,前妻结账时服务员:银行卡已冻结

千秋文化
2026-05-14 20:21:00
汶颂男子200米预赛效仿博尔特回头望月 20秒97轻松锁定小组第一

汶颂男子200米预赛效仿博尔特回头望月 20秒97轻松锁定小组第一

劲爆体坛
2026-09-26 11:11:03
33岁巅峰辞官!《兰香如故》最狠真相:一场家暴,毁掉整个豪门

33岁巅峰辞官!《兰香如故》最狠真相:一场家暴,毁掉整个豪门

野路乐熊
2026-09-26 08:03:24
一旦爆发战争多少人愿意为国而战?美国44%,日本11%,中国多少

一旦爆发战争多少人愿意为国而战?美国44%,日本11%,中国多少

蜉蝣说
2026-09-20 16:28:28
血管堵到什么程度会心梗?冠心病的信号、检查与就医时机全解

血管堵到什么程度会心梗?冠心病的信号、检查与就医时机全解

39健康网
2026-09-25 22:03:36
世体:姆巴佩若伤缺28天,FIFA将须向皇马支付赔偿

世体:姆巴佩若伤缺28天,FIFA将须向皇马支付赔偿

懂球帝
2026-09-26 15:27:38
直播3小时副乳走光无人管:流量退潮时,体面才是最后的遮羞布

直播3小时副乳走光无人管:流量退潮时,体面才是最后的遮羞布

放开他让wo来
2026-09-16 00:05:28
亚运会女子马拉松:次仁措姆2小时27分43秒摘银,吴冰第8名完赛

亚运会女子马拉松:次仁措姆2小时27分43秒摘银,吴冰第8名完赛

全景体育V
2026-09-26 09:30:01
库里降薪续约!直言不会因冠军而频繁换队,詹皇调侃:你毁了联盟

库里降薪续约!直言不会因冠军而频繁换队,詹皇调侃:你毁了联盟

你的篮球频道
2026-09-26 11:08:48
美日韩外长发表声明,不许改变台海现状,不到24小时,中方罕见表态

美日韩外长发表声明,不许改变台海现状,不到24小时,中方罕见表态

闻识
2026-09-25 06:02:23
尴尬了!丈夫吐槽妻子几万月子中心不好好吃饭,天天点外卖,网友吵翻:没得公主的命,却得了公主的病

尴尬了!丈夫吐槽妻子几万月子中心不好好吃饭,天天点外卖,网友吵翻:没得公主的命,却得了公主的病

火山詩话
2026-09-24 06:51:49
【亚运】时隔28年晋级四强!中国队3比0泰国队

【亚运】时隔28年晋级四强!中国队3比0泰国队

体坛周报
2026-09-26 16:15:14
别被骗了!晚会嘉宾看似随口聊天,全盯着大屏逐字念,一张巨型提词器曝光:现场“即兴感”,原来是一场精心编排

别被骗了!晚会嘉宾看似随口聊天,全盯着大屏逐字念,一张巨型提词器曝光:现场“即兴感”,原来是一场精心编排

火山詩话
2026-09-26 08:39:01
随着国足3-0大胜泰国,4强战韩国时间确定,亚运最新争冠形势出炉

随着国足3-0大胜泰国,4强战韩国时间确定,亚运最新争冠形势出炉

球场没跑道
2026-09-26 15:54:54
法媒:摩洛哥升至FIFA第5,平非洲最佳排名,此前为尼日利亚

法媒:摩洛哥升至FIFA第5,平非洲最佳排名,此前为尼日利亚

懂球帝
2026-09-25 21:51:35
2026-09-26 16:35:00
凤凰网财经 incentive-icons
凤凰网财经
离用户最近的财经媒体!
7970文章数 10247关注度
往期回顾 全部

头条要闻

刘欢妻子曾让窦文涛辟谣:媒体说刘欢"没脖子"品味低下

头条要闻

刘欢妻子曾让窦文涛辟谣:媒体说刘欢"没脖子"品味低下

体育要闻

奇迹之子,亚运七金王,张展硕的19岁秋天

娱乐要闻

痛心!63岁歌手刘欢因病去世

财经要闻

盖茨:AI已强大到足以造成"10亿人死亡"

科技要闻

拖了近10年,特斯拉Semi终于量产!

汽车要闻

可城可野可旅行 捷途旅行者 7 双车预售14.99万起

态度原创

时尚
家居
旅游
手机
本地

老钱们沙漠远游穿什么?看看这场秀就知道

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

稻浪飘香迎丰收!曲靖沾益李家村解锁田园文旅新玩法

手机要闻

vivo S2 FE手机曝光:联发科天玑7300e芯片、10000mAh容量电池

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

无障碍浏览 进入关怀版