网易首页 > 网易号 > 正文 申请入驻

黄仁勋为何力挺梁文锋、杨植麟?

0
分享至


爆改大模型,抢夺定价权。

来源:腾讯科技

文:李彪 编辑:苏扬

7月27日深夜,Kimi K3完整权重挂上了Hugging Face。

十天前它发布时,中文圈的讨论多停在跑分与“开源追平闭源”上——头部基准逼近GPT-5.6 Sol和Claude Fable 5。但对技术人来说,架构清单比跑分更重要:注意力换成KDA混合线性机制,残差连接换成注意力残差,优化器换成按头调节的Muon。

深度学习沿用九年的“三大件”,在一个模型里都被重做了一遍。

3月17日,杨植麟在GTC上做了一场《How We Scaled Kimi K2.5》的四十分钟演讲,整场演讲他没有提任何芯片管制。杨植麟透露,对“三大件”动刀源自于高质量数据是有限的这堵“数据墙”。

他说:“token效率不只是效率问题,它实际上也在抬高智能的上限。”可以这样理解:当数据堆到尽头,模型能从每个token里多学到多少,就决定了智能还能再涨多少。

算力的围墙,把中国公司围在里面,而数据墙挡在所有人面前。在笔者看来,这两种叙事并不冲突,数据墙决定这条路迟早有人走,算力墙决定谁先走、要走多快。回头看这四年,MLA、DSA、KDA,再加上把MoE推到极限稀疏的路线,这条时间线上密度最高的架构创新,几乎全部出自算力围墙之内。


这里插播一条课程资讯:

报名黑马 AI 时代资本战略精品课」,8月14日-16日,卫哲、朱啸虎、吴世春、冯卫东等一线顶级投资人亲临授课,搭配FA专业辅导+黑马投资联盟资源加持,手把手帮你优化融资BP、打磨商业路演,精准传递企业核心资本价值,高效链接多家头部投资机构。

早鸟特惠报名中,欢迎优质创始人同行交流报名。

扫码咨询报名

(翻到底部了解详情)

01

围 城

2022年10月起,美国对华出口管制将高端AI芯片列入清单。A100、H100、H20,这中间的细节我们不再赘述。

今天回过头来看,算力围墙拦得住芯片、设备、内存颗粒,却拦不住模型架构设计。因为注意力、更新规则、参数组织都不需要过海关。而且,算力墙修得越高,墙内拆Transformer就拆得越狠。

一切都要从推理时的显存开销说起。

推理显存开销当中,一笔是全场均摊的模型权重:无论谁来推理,都要加载同一份。

另一笔是各自记账的历史信息:Transformer每生成一个token,都需要回看全部上下文,从中取用相关部分。为避免反复从头重算,过去每个token、每一层的Key和 Value向量都必须留底。这份留底就是KV cache,它好比会话的笔记:上下文每推进一步,笔记就加厚一页;并发每多一个会话,就得另备一整本。

以Llama 3.1-70B为例,单token约320KB。128K上下文下,一个会话要40GB显存;100万token则要320GB。可英伟达旗舰Rubin单卡显存总共也才288GB,一个百万token的会话,一张最顶级的卡,搭配的显存也根本装不下。

与此同时,由于大模型解码是逐字生成:每写一个新token,都得把权重和笔记在显存里完整搬一遍。所以,笔记的搬运也是一个难题,这依赖于高带宽内存支持。

所以,按token计费的生意,收入上限取决于显存的两个规格:容量和带宽。

02

参数的两本账

算力围城里的中国模型,第一刀瞄准了训练与推理共用的算力:既然请不起所有专家“全员上岗”,就让特定参数的专家轮班,也就是MoE混合专家模型的起源。

MoE把巨型网络拆成许多“专家”。每个token进来,路由器只点其中几个出场。DeepSeek是这条路的主力,Kimi则把这条路拓得更宽。

2024年底,当时DeepSeek V3做到了6710亿总参数,但每个token只激活370亿;Kimi K2推至1万亿总参数、320亿激活;刚刚上线的Kimi K3,直接把参数拉到2.8万亿总参、1042亿激活。

由于总参数对应的是知识容量,只有激活参数才涉及算力账单,故而两本账就此分开。


减少激活参数之后,另一刀落在了每个参数占的字节之上。

DeepSeek V3用FP8跑通了6710亿参数的完整训练,放在2024年底,在全球范围内都算激进。两年后的 Kimi K3又往下压一档:推理权重用MXFP4,再叠加从SFT阶段就开始的量化感知训练。字节缩小一半,同等显存与带宽,就能多搬一倍参数。

训练过程本身也有可省之处。2024年底,研究者Keller Jordan在nanoGPT提速竞赛里拿出了Muon优化器,单次训练试验成本约8美元。次年1月底,Jordan加入OpenAI;一个月后,月之暗面把相关博客当作正式文献引用,在百亿参数级别验证出约为AdamW两倍的算力效率,随后用改良的 MuonClip 训完了1万亿参数的K2。K3又把它细化到按注意力头独立调节。

此外,注意力残差(AttnRes)对残差连接动刀:每层输出不再无差别地叠回主干,而是用注意力对前面各层做选择性聚合,让深层学会自主回取哪些层的表征。

按Kimi的论文口径,训练算力可省两成。上了K3旗舰之后,注意力残差自己也做了减法:把全部层折成8块来记账,把开销压住。

在中国模型动刀拆墙的过程中,有一个流传很广的数字——DeepSeek V3的完整训练用了约279万H800 GPU小时(1张H800显卡持续运行1小时即为1个GPU小时),按租赁价折算五六百万美元;而同代美国旗舰的训练预算,普遍高出一个数量级以上。

拆墙并不是绝对的完美。参数轮班也把问题从算力搬到了容量。MoE省算力,却不省权重。在MXFP4精度下,K3权重仍有1.4TB左右。为满足专家并行、通信和吞吐要求,官方建议64卡起步。这就好比是,专家们学会了轮班,宿舍却一间不能少。

03

从笔记本到白板

超长上下文是国产大模型突围的重要方向。近四年大致经历四步:共享KV、压缩KV、按需读取、重写“记忆”机制。

第一步是共享:MQA共享一套KV,GQA分组共享;例如Llama 3.1-70B将64个查询头分成8组,把单token缓存从约2.5MB降到320KB。

第二步是压缩:DeepSeek 2024推出MLA,把上下文映射到低维存储、推理时再还原;相较67B的GQA基线,KV开销再降93.3%,并沿用至DeepSeek V2之后的系列。

第三步是按需读取:并非每一步都要重读全部上下文。DeepSeek 2025起推进稀疏注意力(V3.2轻量打分筛选,V4加入记忆合并与分层筛选);在V4-Pro的百万token场景里,计算量降至前代27%,KV占用降到10%。

第四步是改写记忆:从“越写越厚”的KV账本,走向线性注意力的固定维度矩阵状态,通过覆盖与遗忘控制体积;关键不再是只写入,而是学会记什么、何时忘。


为兼顾推理效率与长文本精度,Kimi采用3:1混合架构:3层KDA线性层穿插1层全注意力。相比传统MLA基线,KV缓存最高省75%,在百万token上下文下吞吐提升6倍。

这套设计已用于2.8万亿参数的K3:用门控MLA取代原全注意力层,93层中约3/4为 KDA、1/4为门控MLA。

KDA的状态大小固定;MLA每个token只存低维向量,24层合计约24KB。对比 Llama 3.1-70B的单token 320KB,K3虽大40倍,缓存反而小13倍。

但“白板矩阵”也带来新问题:矩阵化记忆无法像传统KV缓存那样按前缀拆分复用。Kimi因此重写缓存逻辑并贡献给vLLM,同时采用差异化定价:命中复用每百万token 0.3 美元,未命中3美元。

同样100万输入token,是否复用既有“状态”会让成本相差10倍——token只是表面单位,真正决定账单的是状态的生成、保存与复用。

04

分 岔

在长文本优化这条战线上,各家走出了不同的技术路线。

DeepSeek的解法是稀疏压缩:笔记照记,但压小、挑着读;Qwen和Kimi选择混合线性;智谱的GLM-5则把 MLA、DSA 等既有零件重新组合。

GLM-5最能说明问题的一处改动,是将MLA的每头维度从192提到256,同时把头数削减三分之一。报告给出的理由是:DeepSeek-V3的头数是按H800的硬件特性选定的,换到其他芯片上就未必合适。同一套MLA,换一块芯片,模型里的结构常数也可能需要重新计算。

一套架构通吃所有芯片的时代或许正在结束。同一模型家族未来可能从训练阶段起,就会针对不同的显存容量、互联方式和低精度单元,分化出不同的头数、专家布局与精度方案。模型会像程序一样,按机器分别“编译”,而不是一份checkpoint到处运行。

MiniMax的路线最曲折。

M1采用线性注意力与Softmax注意力的混合架构;M2转向全注意力,M2.5延续了这一选择;到今年6月发布的M3,MiniMax才进一步转向MSA稀疏注意力。M2发布两天后,预训练负责人孙浩海在知乎和X解释过这次“撤退”:小模型上混合结构效果很好,但规模做大后,复杂多跳推理会明显吃亏;而检索等依赖全局注意力的能力往往在预训练早期就定型,事后很难补救。因此问题不一定在结构本身,而在评测与规模验证不足——不把模型做大,结论很难成立。

巧合的是,长文发布的第二天,Kimi Linear的论文也挂上了arXiv:同一类“线性/混合”零件,两家旗舰模型,前后脚给出相反的答案。Kimi把它推到2.8万亿参数的K3,等于让旗舰模型用结果回答。

孙浩海还提醒:当GPU算力增长赶不上上下文长度带来的压力时,线性/稀疏注意力的收益会逐步显现,需要提前布局。

今年6月发布的MiniMax M3最终搭载自研MSA稀疏注意力。三代模型,线性、全注意力、稀疏各走一站。这至少说明,即使MiniMax在M2和M2.5保留了全注意力,也没有把它当作不再改动的终点。

行业的共识是:谁也没敢把Softmax注意力清零,分歧只在留多少、留在哪。回想一年前,行业问的是“敢不敢用”,现在问的是“还剩多少不敢动”。

05

白送的token

解码阶段受限于带宽,芯片大半时间都在等数据。针对这个问题的最优解,就是让每一次“等来的搬运”多干点活。

多token预测(MTP)是V3埋下的种子:一次前向顺手预测后续token。投机解码把它系统化:小号草稿模型先猜出五个候选,大模型再用一趟前向同时“判卷”。判五个和写一个耗时几乎相同,时间主要花在搬运权重和笔记上,因此顺路多验四个token几乎不额外付费。

上个月DeepSeek发布的DSpark又把这套玩法推进了一步:引入置信度打分与负载感知调度,同一份V4权重下,单用户出token速度提升了六成到八成半。

Kimi则是把“爆改”带入了系统层面。

Kimi的服务平台把集群里空转的CPU、主内存和固态盘编成共享缓存层:请求命中已计算过的前缀,就直接取现成结果,不再重跑。

按论文口径,它一天经手的token超过1000亿。其传输引擎先后进入vLLM、SGLang 与TensorRT-LLM,让“笔记”从显存一路下沉到主存与固态盘。这套当年为省卡逼出来的架构,如今已成为主流开源推理栈的现成选项。

参数、长文本等机制优化下来,训练侧让每个FLOP榨出更多智能,推理侧让每个字节吐出更多token。算力墙从未变矮,但墙内的单位产出却在翻倍增长。K3技术报告给了一个官方数:整体scaling效率约为上一代K2的2.5倍。

如果我们把中国模型在拆墙过程中的优化放在一起看,它们做的其实是同一件事。

Transformer原本的设计,每一处都是按照最坏情况留足余量。每个参数都被使用,每段历史都全量重读,每一趟权重搬运只产出一个token。而MoE让参数按token激活,稀疏和线性注意力让历史按需读取,注意力残差让层间信息选择性回取,投机解码让一次搬运承担多个token。

上述优化路径,都是为了不再让每一步都为最坏情况全额付费。如果要总结一下这种优化理念,可以说:算力围墙这那道无法控制的硬约束,被拆成了一笔可以调度的成本。

每一次优化,都相当于白送了token。

06

为突围买单

混合架构正成为2026年的常态。按当前旗舰模型看,未来两年单token缓存还会继续大幅下降,甚至再降近一个数量级。

全注意力不会消失,但可能从“固定主干”变成“按需精确能力”:大多数token走更便宜的路径,遇到引用、回溯或复杂多跳推理时,才调用全局检索。

这种按需分配也会扩展到专家、推理深度和精度:系统会按任务难度、时延要求和实时负载分配算力,相当于给每个token标一个内部成本。

硬件需求也会随之重排:KV/缓存压力明显减轻,同一张卡可承载更长上下文和更高并发;但 MoE 把总参数推到万亿级,常驻权重反而成为容量大头(动辄 1.4TB),同时多机路由让瓶颈更多转向卡间互联带宽。

两种约束里,单卡性能“买不到就没办法”,互联方案却能工程化解决。MoE 把“需要一张造不出的超大卡”变成“用一群能连起来的普通卡”。以 V3 为例,通过把每个 token 的路由限制在最多 4 个节点内,并让通信与计算重叠,最终在互联带宽受限的条件下完成训练。买卡标准也因此改变:算力的重要性在下降,容量与互联在上升。


从总量看,这件事很反直觉:效率提高了,需求总量不降反升高。经济学将这种现象称为“杰文斯悖论”:十九世纪英国蒸汽机效率大幅提高,煤炭消耗却一路上行。原因在于,门槛每降低一截,原先烧不起煤的行业就会多进来一批。

大模型也一样,token越便宜,百万上下文、深度推理、常驻agent等新需求就越快涌入,把省下的算力和内存迅速填满。

K3就是典型的例子:48B试验里KV压缩最多省 75%,但到旗舰版,这些空间被用来换1M上下文、thinking常开和2.8万亿参数;输出价每百万token 15美元,接近K2.6 的四倍。月之暗面商业化负责人黄震昕回应媒体:

“我们的定价不是朝一个非常便宜的价格去定的,也想借这个机会告诉全世界,开源模型,包括中国模型,不是低价标签。”

压缩最狠的一代,反而成了最贵的一代。

账单里变化最明显的是存储:今年一季度DRAM合约价环比涨约九成。逻辑很简单:省下的显存很快被更长上下文、更高并发、更大参数吃掉,需求从HBM外溢到主存和固态盘,推高价格。

趋势也很明确:单token内存开销会继续降,但集群的总内存需求仍会上升。无论路线如何分化,长上下文、并发和大参数都在“要更多内存”——算力在分家,内存在收租。

架构迭代会改写账单的结构,却不会改写账单的方向:至少在可见的未来,单位成本下降带来的不是总额缩小,而是更多原本用不起的需求进入账单。

07

没走完的路

三场仗都还没有终局。再往远处看,还有几条路,停在不同的位置。

Mamba-3、RWKV-7已移除全注意力,但公开验证的规模远低于旗舰模型;精确检索能力能否在规模扩张后仍然成立,依旧没有定论。

扩散语言模型则从生成顺序入手:如果并行修改文本能同时跨过质量与高并发的门槛,“搬一次权重只能生成一个token”的前提就会被打破,投机解码可能因此退化为过渡方案。

TTT改的是记忆的存放位置。TTT-E2E在3B 规模上将上下文写入推理期参数,在128K上下文下比全注意力快2.7倍,且延迟不会随上下文增长而增加。目前这种写入只发生在一次推理中;若未来能跨会话持久化,又不引发遗忘与污染,长期agent将在基础权重之外携带私人状态,同一底模也可能随用户使用逐渐分化。

未来两年,主线仍会是混合架构。再往后,旗舰模型可能同时采用多种机制:常规token走低成本路径、精确检索按需唤醒、长期状态则单独更新。一份checkpoint只是其中一层,竞争单位将上移到负责选路、记忆与硬件适配的运行系统。

V4、K3的论文与权重公开,Kimi Linear的内核开源,KDA的缓存实现进入vLLM。开源让零件更快沉淀为公共组件,议价权随之向运行时与状态层转移。结果可能是:创新发生在中国,标准留在开源社区,利润却被内存厂、云平台和应用拿走。中国模型公司要避免这一结果,就不能只出售权重与token,还需要进入托管运行时与长运行agent。

那么,谁在给这套生态“背书”?

K3权重上传到Hugging Face的三天前,黄仁勋就在X发出入驻后的首帖,转发了一封支持“开放权重、维护美国AI领导地位”的联名公开信——当时华盛顿正讨论要不要限制中国开源模型。最初25个签名覆盖芯片厂、云平台、应用公司和风投;两天内人数翻倍,OpenAI和谷歌也补签,但Anthropic一直没签。

英伟达的逻辑很简单:权重越开放,模型越像公共零件,买卡的人就从少数巨头变成更广泛的开发者和企业,芯片生意更稳。真正让英伟达紧张的反而是大客户自研芯片:OpenAI联合博通做自研,Anthropic把主力算力押在谷歌TPU。闭源巨头往下游造芯片,开源阵营往上游抬需求;围墙能挡英伟达把卡卖进中国,却挡不住中国开源权重在海外继续拉动对英伟达算力的需求。

围城仍在,突围仍在提速。

当初,这堵墙当初要拦的,是墙内的人还能造出什么;四年过去,从芯片的形状、内存的价格到智能的标价,改写全球账单的笔,反而握在了被围的人手里。

*免责声明:本文章为作者独立观点,不代表i黑马立场。

这里认真推荐你报名:

《黑马 AI 时代资本战略精品课》

融资屡屡碰壁,本质是没吃透当下资本市场底层逻辑。

依托创业黑马18年创业融资深耕积淀,本次资本精品课集结了卫哲、朱啸虎、吴世春、冯卫东等行业大咖,带领创始人重构资本认知、打磨融资BP、精进路演能力,一站式对接头部资本,打通企业融资成长快车道。

时间:8月14日-16日

地点:上海

活动详情如下,扫码咨询报名


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
所有人都认定电车必将取代油车!谁能想到半路杀出个程咬金

所有人都认定电车必将取代油车!谁能想到半路杀出个程咬金

小怪吃美食
2026-07-30 15:46:40
陕西女法官提拔遭遇双重举报!官方回复遭律师直接反驳

陕西女法官提拔遭遇双重举报!官方回复遭律师直接反驳

听心堂
2026-08-01 09:55:18
5800万年轻人不交社保了:断缴的不是懒惰,是生存的算术

5800万年轻人不交社保了:断缴的不是懒惰,是生存的算术

互联网大观
2026-07-21 10:03:18
破天荒了,伊朗主动打击美军!世界最大炼油厂爆炸,特朗普陷死局

破天荒了,伊朗主动打击美军!世界最大炼油厂爆炸,特朗普陷死局

史料布籍
2026-07-30 22:11:44
乌军炸坏炼油厂后,俄罗斯要把原油送出国,炼成汽油再运回

乌军炸坏炼油厂后,俄罗斯要把原油送出国,炼成汽油再运回

桂系007
2026-07-31 04:23:59
前育碧开发者潜入废弃修道院,靠1台拍立得调查4名修女弑母之谜

前育碧开发者潜入废弃修道院,靠1台拍立得调查4名修女弑母之谜

峡谷一级保护废物
2026-08-01 00:36:36
8月7日立秋,今年立秋是“闭眼秋”,老辈说的“闭眼秋”是什么意思?是好还是坏?

8月7日立秋,今年立秋是“闭眼秋”,老辈说的“闭眼秋”是什么意思?是好还是坏?

小谈食刻美食
2026-07-29 07:59:35
独立报:曼联考察阿森纳后卫斯凯利,并推进纽卡霍尔交易

独立报:曼联考察阿森纳后卫斯凯利,并推进纽卡霍尔交易

懂球帝
2026-08-02 07:34:13
别克至境L7纯电版8月5日预售,全系续航超700km、支持6C快充

别克至境L7纯电版8月5日预售,全系续航超700km、支持6C快充

全栈遛狗员
2026-07-31 15:06:51
放弃维尼修斯!阿森纳锁定皇马失意天才,阿尔特塔捡到未来基石

放弃维尼修斯!阿森纳锁定皇马失意天才,阿尔特塔捡到未来基石

澜归序
2026-08-02 06:34:27
穆里尼奥看清现实!皇马头号水货彻底现形!昔日天才断崖崩盘

穆里尼奥看清现实!皇马头号水货彻底现形!昔日天才断崖崩盘

澜归序
2026-08-02 05:50:44
2026欧洲1-6月汽车销量:大众185万辆,丰田第6,中国2车企进10强

2026欧洲1-6月汽车销量:大众185万辆,丰田第6,中国2车企进10强

小鹏财经
2026-08-01 17:11:07
那声“不要喷水”,为什么没人听?

那声“不要喷水”,为什么没人听?

梳子姐
2026-07-31 20:04:52
长鑫校招名单曝光,安徽高校赢麻了,区位才是金饭碗。

长鑫校招名单曝光,安徽高校赢麻了,区位才是金饭碗。

解说阿洎
2026-08-02 05:04:48
修杰楷认罪不到24小时,贾静雯迎来3大噩耗,个个直戳她心窝!

修杰楷认罪不到24小时,贾静雯迎来3大噩耗,个个直戳她心窝!

小椰的奶奶
2026-07-31 03:11:45
刚刚,“苏超”积分榜更新!

刚刚,“苏超”积分榜更新!

无锡eTV全媒体
2026-08-01 21:49:18
安徽“双面”院长:大搞权色交易,退休四年被审查,难逃牢狱之苦

安徽“双面”院长:大搞权色交易,退休四年被审查,难逃牢狱之苦

比利
2026-08-01 15:45:47
“戏混子”没走,比资本家丑孩子更可怕的是“星二代”开始世袭了

“戏混子”没走,比资本家丑孩子更可怕的是“星二代”开始世袭了

流史岁月
2026-01-26 10:58:30
婚外胚胎案再爆黑幕:丈夫与律师联手,原配被逼到悬崖边

婚外胚胎案再爆黑幕:丈夫与律师联手,原配被逼到悬崖边

记录生活日常阿蜴
2026-08-02 07:02:36
韩红“自大言论”与事实真相对比,请仔细看:

韩红“自大言论”与事实真相对比,请仔细看:

情感大头说说
2026-07-19 07:42:55
2026-08-02 08:23:00
i黑马 incentive-icons
i黑马
抄本质 找灵感 挖黑马
70832文章数 261931关注度
往期回顾 全部

科技要闻

特斯拉拆不掉中国制造

头条要闻

大爷切掉眼镜蛇的头后被咬死死咬住 术后做了三天噩梦

头条要闻

大爷切掉眼镜蛇的头后被咬死死咬住 术后做了三天噩梦

体育要闻

1米76的他,为什么是史上最强中卫之一?

娱乐要闻

韩路批董宇辉“又当又立”?

财经要闻

长鑫科技四万亿市值背后的资本与周期

汽车要闻

历史性里程碑时刻 零跑7月交付达101267台

态度原创

教育
游戏
数码
家居
公开课

教育要闻

图形推理,这些图形都有直线

同人本之王、二游顶流自刎归天,被发现可能是EA高管在搞事情?

数码要闻

PC涨价停不下来!宏碁高管:第三季度再涨5%

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版