网易首页 > 网易号 > 正文 申请入驻

硅谷巨内核遇劲敌!中国超级算子,改写大模型推理格局

0
分享至



2.8万亿总参数、104B激活参数的KimiK3问世之后,开源大模型的能力天花板被直接拉高。但能力越强,落地的难题就越棘手。这套拥有896个专家的MoE大模型,普通服务器很难扛住压力,没有专门优化的硬件环境,跑起来速度仅有10tokens/s,输出文字慢吞吞,几乎没法投入实际使用。



过去大家总觉得,大模型跑不快,就是芯片算力不够。可海内外工程师在实测中慢慢发现,真正拖后腿的不完全是计算能力,而是没完没了的数据搬运、芯片之间的通信等待。9月下旬,海内外几乎同时拿出两套截然不同的解决方案,海外团队选择把整个模型打包成一个巨型内核,国内浪潮信息则依靠本土芯片超节点搭配超级算子完成突破。两条路径殊途同归,都指向同一个方向:大模型的竞争,已经不再只是模型算法的比拼,而是落到系统软件、内存管理、芯片互联的底层较量。

一、万亿MoE的真实困境:算力闲置,搬运拖垮速度

很多人对万亿参数模型的想象,就是堆更多更强的AI芯片。可KimiK3的运行现实,打破了这种简单认知。

作为超大MoE混合专家模型,KimiK3单次前向计算就要消耗约1.5TB的HBM带宽,896个专家分散在不同芯片上,每一轮运算会触发超过120次跨芯片All‑to‑All数据传输。就算芯片本身算力再强,数据传不过来,算力就只能原地空转,白白浪费硬件资源。

尤其到了解码阶段,也就是AI一字一句生成回答的环节,痛点会被进一步放大。传统推理框架vLLM、TensorRT‑LLM习惯把任务切分成很多细碎算子,每一个算子都要独立启动内核,完成读取、计算、写回,再交给下一个算子执行。每一次切换,都会产生等待空隙。大量细碎的空闲时间叠加在一起,就造成硬件理论性能很高,实际输出速度却上不去的尴尬局面。

简单打个比方,就像货物运输,货车马力很足,但是中途要反复停靠站点卸货、转运,大部分时间都耗在装卸等待,真正跑在路上的时间并不多。想要提速,就需要减少中途停靠,把零散的流程整合起来。于是行业开始探索打破算子之间的边界,把分散的计算流程融合在一起,减少数据反复读写。

二、两条技术路线:巨内核与超级算子,各有取舍

面对同一个难题,海外Inferact团队和国内浪潮信息走出两套不一样的技术路线,但底层逻辑高度一致,都在追求极致的计算融合。

海外Inferact开源了tpu‑megakernels项目,依托谷歌TPUv7芯片,把KimiK3全部92层MoE网络塞进单个内核当中。整套解码流程在同一个内核内部一气完成,计算当前层的时候,就用异步DMA把下一层权重提前搬运到片上高速存储VMEM中。依靠TPU硬件可以手动管控片上内存数据生命周期的特性,调度哪些数据预加载、哪些数据留存、哪些数据立刻释放,把整个模型视作一条不间断的数据流。



实测在16颗TPUv7的硬件条件下,低并发解码吞吐直接冲到709tokens/s,性能表现十分亮眼。不过这套方案高度绑定TPU硬件架构,很难直接迁移到其他芯片平台。



浪潮信息元脑SD200Ultra超节点没有追求“整个模型一个内核”,而是选择把大量细碎的基础算子,融合成体量更大的超级算子。针对KimiK3的KDA注意力、GatedMLA、MoE专家模块做深度改造,算子整体数量直接降低10倍,推理性能提升三倍以上。



具体分为两步落地。第一步是把碎片化的小算子合并,按照片上存储划分数据块,前一步计算结果直接留在寄存器、片上缓存,不用反复读写低速显存HBM,省去大量读写开销。第二步实现计算和通信并行,用Tile数据块搭建流水线,预取新数据、执行当前计算、回写上一轮结果三件事同步开展,跨芯片通信的延迟直接“藏”进计算过程中,不让传输拖慢整体节奏。最终在128颗本土AI芯片紧耦合的单机之内,把KimiK3单Token生成时延做到5.85毫秒,单用户输出可达170tokens/s,实现国产硬件上的重要突破。



三、AI优化AI:用KimiK3生成超级算子

超级算子效果出众,但开发难度很高。不同模型、不同硬件组合之下,数据怎么复用、通信和计算如何配合,都要反复调试验证,纯靠工程师手工编写,工程量大到难以承受。

浪潮信息尝试了一个很有意思的新思路:用KimiK3优化KimiK3,打造超级算子智能体,让大模型反过来参与底层算子的设计迭代。由智能体自动生成适配KimiK3的通算融合、Tile流水线超级算子,完成计算、通信、数据搬运的协同调度,再交由模型本身做正确性校验,循环迭代打磨性能。经过这套智能体优化,整机性能再度提升50%。



浪潮信息首席AI战略官刘军做过一个通俗比喻:过去传统推理,几百个算子串联运行,就如同绿皮火车,一路经过几百个小站点,反复启停装卸数据,效率低下。而超级算子相当于一站直达的高铁,砍掉中间大量停靠带来的无效损耗。

这个变化也带来新启示:大模型不再仅仅是被优化运行的对象,也变成了优化算力基础设施的工具。由AI自动完成底层算子调优,很有可能成为下一代推理优化的主流范式,缓解底层开发人力紧缺的行业痛点。

四、芯片之外,系统工程才是本土算力的护城河

Agent智能体时代正在到来,Token消耗量迎来爆炸式增长。根据机构预测,Agent单任务消耗Token是普通聊天机器人的5‑30倍,到2030年全球每月Token消耗将达到120000万亿规模。激增的需求,对算力供给提出两个方向的考验。



一方面是“向上突破”:KimiK3这类超大模型,追求更强推理、百万级长上下文、多智能体协同,对单机算力、显存容量、互联速度提出极高要求;另一方面是“向外普及”,大量中小企业调用AI服务,需要海量、低成本的Token供给。

对应两种需求,浪潮信息提出能力型智算与容量型智算双线并行的思路。能力型智算依靠SD200Ultra超节点,搞定前沿超大模型,解决“模型能不能跑得动、跑得快”;容量型智算依靠HC2000多元算力机组,针对Prefill、Decode、FFN不同任务分配合适芯片负载,同等投资之下,Token产能提升10倍,面向千行百业做普惠供给。



客观来讲,单颗芯片层面,国内产品对比海外顶尖产品还有差距。但超节点给了本土算力另一条突围路径:不靠单芯片的绝对性能,依靠系统层面的整合创新实现追赶甚至局部超越。SD200Ultra依靠3DHyperMesh架构,把128颗本土AI芯片紧耦合,实现8TB统一编址显存,通信时延压低到0.69微秒,完成显存直连,AllReduce通信耗时降低3.5倍。

真正的超节点,核心标志就是统一内存寻址。只有实现这一点,众多芯片的显存才会融合成一整片资源池,完整放下万亿级大模型。如果做不到统一寻址,只是一堆服务器简单堆在一起,那只能叫集群,依旧要把模型拆成片段运行,效率会大打折扣。芯片是手里的一张牌,系统工程是另一张关键的牌。把芯片互联、内存管理、算子融合全部打通,才能释放系统带来的额外红利,这也是当前本土算力最确定的追赶路径。

五、万亿模型推理革命才刚刚起步

Inferact用16颗TPU证明,把整套万亿模型塞进单一巨内核,能够跑出惊人性能;浪潮信息用128颗本土AI芯片,靠超级算子与超节点系统,完成商业化落地。两套方案路径不同,却共同印证一件事:AI算力竞赛已经不单单比拼单芯片极限性能,更考验如何把一堆芯片高效组织起来。

万亿参数大模型推理的效率革命才刚刚拉开序幕。当算子边界被打破,AI智能体参与底层调优,超节点实现统一显存池,本土算力就算在芯片工艺受限的现实条件下,依旧可以依靠全栈系统创新,站到全球第一梯队。未来,更大规模的模型、海量Agent应用会持续涌现,推理效率的优化,会持续决定AI产业落地的真实上限。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
女球迷大喊想嫁给郑钦文!她脱口甩出一句“我喜欢男的”,全场直接笑翻

女球迷大喊想嫁给郑钦文!她脱口甩出一句“我喜欢男的”,全场直接笑翻

乡野小珥
2026-09-30 07:54:09
父亲用毕生积蓄买下12枚硬币,临终让我拿去拍卖,鉴定师看后傻眼了

父亲用毕生积蓄买下12枚硬币,临终让我拿去拍卖,鉴定师看后傻眼了

温情邮局
2025-08-16 15:25:59
日本乒坛炸裂了!松岛辉空拒绝跟张本家组队,在赛场上公开演戏

日本乒坛炸裂了!松岛辉空拒绝跟张本家组队,在赛场上公开演戏

妙知
2026-07-15 09:59:09
900 万捡漏!皇马挖到王牌接班人!21 岁天才碾压伯纳乌老将

900 万捡漏!皇马挖到王牌接班人!21 岁天才碾压伯纳乌老将

澜归序
2026-10-01 09:55:55
赢了所有比赛,却可能留不下?林诗栋被调侃去德国,饭圈才是推手

赢了所有比赛,却可能留不下?林诗栋被调侃去德国,饭圈才是推手

曹老师评球
2026-09-28 20:38:42
亚运最新金牌榜!中国队151枚高居第1,还有多少冲金点?

亚运最新金牌榜!中国队151枚高居第1,还有多少冲金点?

刘笤说体坛
2026-10-01 10:16:12
王平河:核桃为义断指

王平河:核桃为义断指

金昔
2026-10-01 15:39:11
勇士做出巨大调整!科尔直言全队仅两人确定首发,波杰续约成难题

勇士做出巨大调整!科尔直言全队仅两人确定首发,波杰续约成难题

你的篮球频道
2026-10-01 08:19:09
吴艳妮:全运会后训练上强度就流血;结婚生子不是我的课题

吴艳妮:全运会后训练上强度就流血;结婚生子不是我的课题

懂球帝
2026-10-01 18:17:20
柯志恩称绿营若败是人选问题,陈其迈回呛:投柯就是支持郑丽文

柯志恩称绿营若败是人选问题,陈其迈回呛:投柯就是支持郑丽文

刘浶开挖机
2026-10-01 15:44:20
被认定违规后,曼城赞助商阿提哈德航空称正考虑对英超采取法律行动

被认定违规后,曼城赞助商阿提哈德航空称正考虑对英超采取法律行动

日常碎碎念啊
2026-10-01 04:31:15
蒋介石晚年反复痛悔:一生中最错误的决定,就是抗战结束后没有及时把主力部队撤出东北

蒋介石晚年反复痛悔:一生中最错误的决定,就是抗战结束后没有及时把主力部队撤出东北

磊子讲史
2026-07-20 15:48:31
岳父眼里的刘欢:他做得一手好菜,性格朴实,是孝顺贴心的半个儿

岳父眼里的刘欢:他做得一手好菜,性格朴实,是孝顺贴心的半个儿

细品名人
2026-10-01 06:38:33
“带着你的咖喱滚回家”:因为一座90英尺神像,美国议员将矛头对准印度裔火力全开

“带着你的咖喱滚回家”:因为一座90英尺神像,美国议员将矛头对准印度裔火力全开

步论天下事
2026-09-30 11:55:12
哈里王子获亚马逊1.78亿元大赞助,但有个条件:活动必须带上梅根

哈里王子获亚马逊1.78亿元大赞助,但有个条件:活动必须带上梅根

最美的巧合
2026-10-01 07:33:27
连夜闯关失败!菲防长气急放狠话,022艇现身南海,战局彻底变天

连夜闯关失败!菲防长气急放狠话,022艇现身南海,战局彻底变天

举头月已燕归来
2026-09-30 14:44:52
不死也得扒层皮 相声演员大办婚宴 五代同堂惹众怒 恐步入郭德纲后路

不死也得扒层皮 相声演员大办婚宴 五代同堂惹众怒 恐步入郭德纲后路

手工制作阿歼
2026-10-01 04:38:45
普京签署法令限制俄公民携带现金出境

普京签署法令限制俄公民携带现金出境

名人苟或
2026-10-01 14:36:16
俄军单日伤亡破2千人创历史新高!“下水道”战术被乌军识破

俄军单日伤亡破2千人创历史新高!“下水道”战术被乌军识破

项鹏飞
2026-09-30 19:38:08
毛泽东病危时盼回滴水洞,8年后李讷代父归乡,她却失声痛哭!

毛泽东病危时盼回滴水洞,8年后李讷代父归乡,她却失声痛哭!

大运河时空
2026-09-30 13:00:05
2026-10-01 18:47:00
魏家东 incentive-icons
魏家东
一个人的营销商学院!
3142文章数 12285关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

迪拜客机乘客披露救治细节:机长倒在血泊 手几乎被切断

头条要闻

迪拜客机乘客披露救治细节:机长倒在血泊 手几乎被切断

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

宋佳二封金鹰视后 内娱奖项史即将改写

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

时尚
亲子
艺术
家居
公开课

在米兰,用时装唤醒内心的自我

亲子要闻

潮州潮韩新时代月子中心的服务真的好吗?

艺术要闻

米芾临摹的《十七帖》,还原王羲之真实的细节,别再被其他版本误导了!

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版