网易首页 > 网易号 > 正文 申请入驻

2.8万亿参数怎么跑快?中美团队同题交卷,答案都指向一件事

0
分享至

2.8万亿参数的大模型,究竟要怎么跑快?这个问题最近被海内外团队几乎同时交出了答卷。

被盯上的是全球最大参数量的开源模型——Kimi K3。它凭借2.8万亿总参数、104B激活参数,刷新了开源模型的性能上限。但普通的AI服务器难以承载这么大参数量的模型,Kimi官方推荐64卡甚至更大规模的AI服务器才能装得下。有业内人士表示,一般未经优化的超节点跑Kimi K3,初始性能可能仅在10 tokens/s左右。


面对同一道难题,国内外团队给出的解法出奇地一致。

两条路线,同一个思路

9月21日,浪潮信息在AICC 2026发布元脑SD200 Ultra超节点AI服务器,通过紧耦合128芯本土AI芯片,单机承载2.8万亿参数Kimi K3,Token生成时延首破5.85毫秒。

9月23日,海外TPU推理优化团队Inferact开源tpu-megakernels,用16颗谷歌TPU v7芯片把整个K3装进一个kernel(内核),配合DSpark投机解码,低并发Decode(解码)吞吐达到709 tokens/s。

一个用本土芯片做商业化超节点,一个用Google TPU做开源推理项目,指向了同一个技术思路:打破算子边界,把大模型推理的计算过程融合到极致。大模型推理的竞争,正从模型算法层,深入到系统软件、芯片互联和内存管理层。

万亿MoE为什么难跑

万亿参数大模型推理为什么慢?很多人以为是算力不够,而实际瓶颈更在于数据搬运和内存带宽。

据知名半导体行研机构SemiAnalysis分析,K3一次前向计算的HBM带宽需求约1.5TB,896个专家需要分布到多张芯片上,每次前向还会触发超过120次All-to-All通信。即便芯片具备强大算力,数据传输跟不上节奏,大量计算能力也会被白白闲置。

对于Decode(解码)阶段而言,问题尤其明显。每生成一个Token,模型都需要持续读取大量权重。vLLM、TensorRT-LLM等传统推理框架往往需要启动大量Kernel,每个Kernel完成自己的加载、计算和写回,然后再启动下一个Kernel。于是,计算之间出现了大量细小的“空泡”。这些碎片化空泡累积起来,就是实际速度与理论峰值之间的鸿沟。

既然kernel边界是浪费来源,那是否可以尝试消灭边界?

一个kernel装下整个模型

Inferact的思路是整个模型就是“一个kernel”。其megakernel方案使用Google Pallas,把K3的92个MoE层放进一个Pallas调用,在一个Kernel内部完成整个解码过程。当前层计算时,下一层权重就可以通过异步DMA提前从HBM搬运到片上VMEM。

这套打法成立的关键是TPU v7的架构特性。每个TensorCore自带64 MiB VMEM,数据进入VMEM后,其生命周期可以由程序显式控制。于是,Kernel作者可以主动安排哪些权重提前搬运,哪些激活继续驻留,哪些数据在使用结束后立即释放。换句话说,Inferact做的是把整个模型看成一个连续的数据流。

浪潮信息没有把整个模型彻底压成一个Kernel。团队把众多基础算子融合成超级算子,用系统级紧耦合架构榨取整体效率。针对K3推理特点,他们把KDA、Gated MLA、MoE中众多基础算子融合为计算与通信协同执行的大算子,算子数量降低10倍,模型推理性能提升3倍以上。

具体来看,第一步是把小算子“焊成”大算子,减少中间停靠。按片上存储容量划分数据块,让前一步的结果直接留在寄存器或片上缓存中供后一步使用,减少kernel launch次数,也避免中间结果反复写入和读取HBM。

第二步,把通信和计算融合,让数据传输和计算同步进行。超级算子按照Tile(数据块)组织流水线,通过异步搬运和多缓冲机制,让下一块数据预取、当前数据计算和上一块结果写回同时进行。跨芯片通信也按照Tile推进,把通信延迟尽可能藏到计算过程里。

前者把整个Decode过程放进一个megakernel,后者把大量细粒度算子融合成超级算子。它们共同指向的,是传统“一个Op(算子)对应一个Kernel”的计算方式正在松动。

用K3优化K3

超级算子能够减少推理过程中的数据搬运与等待,但其设计和优化本身也是一项复杂的工程。数据如何复用、计算与通信如何衔接、不同阶段如何形成流水,都需要结合具体模型和硬件条件进行设计与验证。这些工作需要大量人工投入。

能否让AI参与其中,提高超级算子的生成与优化效率?为此,浪潮信息在元脑SD200 Ultra适配Kimi K3的过程中引入“超级算子智能体”,让Kimi K3参与自身的推理优化。针对K3的推理特点,智能体生成通算融合、Tile级流水的超级算子,推动计算、通信与数据搬运协同执行。

浪潮信息首席AI战略官刘军在采访中打了个比方:过去大模型推理由数百个算子串联执行,如同绿皮火车途经数百个小站,反复启停装卸数据,整体效率低下;而超级算子就像一站直达的高铁,省去中间停靠开销。

刘军谈道,以往行业清楚这套模式的短板,但人工算子优化调度的工作量巨大。如今Agent带来解法,浪潮信息采用“用K3优化K3”的思路,依托超节点系统架构,由AI智能体自动生成超级算子,再经由模型校验迭代,性能较此前再度提升50%,形成循环加速。

模型已经不只是被优化的对象,也开始成为优化基础设施的工具。这可能会成为下一代推理优化的重要范式。

芯片一张牌,系统一张牌

Agent时代,Token消耗增长数百万倍。据Gartner 2026年3月报告,一个Agent工作流每任务消耗的Token量是标准聊天机器人的5到30倍;高盛预测,到2030年全球Token消耗量将较2026年增长24倍,达到每月约120000万亿Token。

需求侧爆发,算力供给如何接住?这里可以看到两个典型困境。

第一个是Kimi K3代表的“向上”。模型越来越大,推理能力越来越强,长上下文、复杂推理、多Agent协同越来越多,单机越来越难承载,算力系统需要不断突破模型能力上限。

第二个是DeepSeek代表的“向广”。当越来越多用户开始调用低成本模型,Token需求会迅速扩张。模型本身可能已经足够便宜,但如果算力供给跟不上,低价Token就很难持续。

浪潮信息的回答是Capability AI Compute(能力型智算)加Capacity AI Compute(容量型智算),两条线齐头并进。向上,SD200 Ultra用5.85ms/token、单用户170 tokens/s,让前沿模型跑得起、跑得快。向广,HC2000多元算力机组用DirectCom 2.0极速架构,Prefill、Decode、FFN按负载匹配多元芯片,同等投资Token产能提升10倍。

中国玩家的护城河在哪里?单看芯片,其与NVIDIA仍有差距,单卡算力、生态、工具链都有明显短板。但到了超节点层面,靠系统级创新可以追平甚至超越单卡更强但系统松散的方案。

以浪潮信息SD200 Ultra为例,其用3D Hyper Mesh架构紧耦合128芯本土AI芯片,提供8TB统一编址显存和64TB内存,通信时延低至0.69微秒。通过对称内存技术,首次在基于本土AI芯片的超节点上实现GPU显存直连,AllReduce通信时间降低3.5倍。

刘军谈道,超节点最基本的特征是显存要统一寻址,这一点做到了,才能把这么大的模型放进去,否则就只能叫节点集群,还是需要把模型拆分成若干段。

芯片是一张牌,系统工程则是另一张牌。当芯片之间能够形成更紧密的连接,内存能够形成统一空间,通信可以藏进计算过程,算子又可以由AI持续优化,单芯片性能之外的系统红利就开始释放。对于本土算力而言,这条路径尤其重要。

效率革命才刚刚开始

AI算力竞争,正从造出更快的芯片变为把现有芯片组织到极致。Inferact用16颗TPU证明一个kernel可以装下2.8万亿参数;浪潮信息用128颗本土芯片证明系统级紧耦合加超级算子,可以让本土算力跑进第一梯队。

两条路线,一个方向。大模型推理的效率革命,才刚刚开始。对中国AI产业,这个方向的特殊意义在于,在芯片工艺受限的约束下,系统级创新是确定性最高的追赶路径。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
北汽集团原董事长徐和谊:把北汽带进世界五百强的人,自己走进被告席丨【商业人物档案】

北汽集团原董事长徐和谊:把北汽带进世界五百强的人,自己走进被告席丨【商业人物档案】

投资者网
2026-09-30 20:04:52
70%欧洲成人片来自这里、妓院比学校多,捷克的桃色不是开放是穷

70%欧洲成人片来自这里、妓院比学校多,捷克的桃色不是开放是穷

春日在捕月
2026-09-20 04:10:36
何猷君够不着蛋糕顶层,奚梦瑶一个动作出圈,豪门媳妇不是一般人

何猷君够不着蛋糕顶层,奚梦瑶一个动作出圈,豪门媳妇不是一般人

感恩每一刻
2026-09-30 06:07:27
1955年,中央派人前往 朝鲜 挖毛岸英坟墓,可当大家刚开始挖,就突然跑过来一名妇女挡住了他们吼道:“这是我儿子的坟,你们不能迁走!”

1955年,中央派人前往 朝鲜 挖毛岸英坟墓,可当大家刚开始挖,就突然跑过来一名妇女挡住了他们吼道:“这是我儿子的坟,你们不能迁走!”

回京历史梦
2026-09-30 18:27:08
印尼前首富的方便面帝国:扒扒林绍良和征服全世界的营多面

印尼前首富的方便面帝国:扒扒林绍良和征服全世界的营多面

食色那些事
2026-09-29 10:10:21
邓亚萍回应评价全红婵被网暴,检讨自己称“我为什么说无知者无畏呢,不可以换个词么?”

邓亚萍回应评价全红婵被网暴,检讨自己称“我为什么说无知者无畏呢,不可以换个词么?”

韩小娱
2026-09-30 13:58:49
确定!这些公务员编制不再招收本科生!

确定!这些公务员编制不再招收本科生!

山东教育
2026-09-28 09:16:49
研究发现:吃一瓣大蒜,或等于给血管添一次堵吗?

研究发现:吃一瓣大蒜,或等于给血管添一次堵吗?

芹姐说生活
2026-09-28 20:02:02
你经历过真正的善良吗?网友:内心阴暗的朋友看看,对你有帮助

你经历过真正的善良吗?网友:内心阴暗的朋友看看,对你有帮助

带你感受人间冷暖
2026-10-01 00:05:42
快讯!俄罗斯传来消息!

快讯!俄罗斯传来消息!

故事终将光明磊落
2026-09-30 16:55:29
饭后没有这3种情况,说明脑梗离你很远,不看真的亏大了

饭后没有这3种情况,说明脑梗离你很远,不看真的亏大了

医学科普汇
2026-09-21 18:10:16
安东尼奥5.8分!国足亚运队评分:王钰栋毛伟杰高分!徐彬3.5分,3将不及格

安东尼奥5.8分!国足亚运队评分:王钰栋毛伟杰高分!徐彬3.5分,3将不及格

刀锋体育
2026-09-30 17:05:41
若中国挖出世界第一大油田,全球格局一夜变天!复兴之路谁能挡?

若中国挖出世界第一大油田,全球格局一夜变天!复兴之路谁能挡?

素衣读史
2026-10-01 02:20:16
曾受北斗无偿援助,如今带头反华不念旧情?该国比越南还可恨!

曾受北斗无偿援助,如今带头反华不念旧情?该国比越南还可恨!

李健政观察
2026-09-20 18:29:22
61%控球35次攻区,印度2比0韩国进决赛将战中国

61%控球35次攻区,印度2比0韩国进决赛将战中国

星河漫山野
2026-09-30 20:53:00
在日本的朋友愣住了:从来没想过,日本人竟然在排队买中国的相机

在日本的朋友愣住了:从来没想过,日本人竟然在排队买中国的相机

莫地方
2026-09-27 15:10:09
妻子在私企上班,我发现她办公室有一条密道,直通老板办公室

妻子在私企上班,我发现她办公室有一条密道,直通老板办公室

千秋文化
2026-09-20 20:03:36
300773,筹划重要收购!

300773,筹划重要收购!

中国基金报
2026-10-01 00:04:39
基辛格当面问毛主席:若苏联进攻中国怎么办,伟人妙答震撼全场?

基辛格当面问毛主席:若苏联进攻中国怎么办,伟人妙答震撼全场?

小莜读史
2026-09-15 09:53:11
迪拜客机差点失控坠毁,机长全身是血最后关头打开驾驶室

迪拜客机差点失控坠毁,机长全身是血最后关头打开驾驶室

三叔的装备空间
2026-10-01 00:52:48
2026-10-01 03:04:49
码上闲叙
码上闲叙
有态度网友ytd
200文章数 96关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

中方不再称高市早苗为“首相” 这个表述值得关注

头条要闻

中方不再称高市早苗为“首相” 这个表述值得关注

体育要闻

30天30队·火箭:乌度卡的控制欲

娱乐要闻

胡歌现身游本昌遗体告别仪式

财经要闻

“杭州六小龙”迎来价值重估

汽车要闻

燃油车的最佳平替 长城大狗HEV简单好开更经济

态度原创

时尚
旅游
房产
本地
军事航空

从理性到反叛,看米兰时装周风格流转

旅游要闻

漫游京城 共赏金秋盛景

房产要闻

利好频发!国庆置业窗口期,收好这份优惠攻略!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

军事要闻

美军最后2500人撤离伊拉克

无障碍浏览 进入关怀版