网易首页 > 网易号 > 正文 申请入驻

Kimi K3“登顶”,正在开启“国产算力1.0时刻”

0
分享至

来源:市场资讯

(来源:21世纪经济报道)

21世纪经济报道记者 赵云帆

近日,由月之暗面发布的Kimi K3模型,以1679分的成绩,力压GPT、Claude系列两大“轮庄”神话模型,登顶全球三大代码类AI基准平台之一FCA的全模型榜首。

中国原生AI模型,第一次真正意义上触碰到了全球“SOTA(最高水平)”的铁王座——而在这背后,一则更为震撼的中国AI算力叙事,已悄然写下了它的注脚。

过去一段时间,国产算力到底能不能撑起前沿模型的推理需求,在产业、舆论端始终存疑。而在K3同步披露的种种信息中,我们却明确地找到了国产算力与国产模型珠联璧合的种种线索。

比如,在配置声明中,K3将“≥64卡超节点”列为其规模化商用的推荐配置,并将前沿算力“金标准”的英伟达NVL72(GB200/GB300)列为达标底座。

而在随后的世界人工智能大会(WAIC)期间,月之暗面却披露已同步适配包括华为昇腾在内的国产芯片。同期,华为在上海展出的昇腾950 SuperPod 64卡“超节点”机柜,似乎呼应了K3将“≥64卡超节点”作为推荐配置的做法。

在这中间,我们甚至能读到,国产模型与国产算力在工程配置上的“默契”。

突破摩尔定律的“集群”

早在几年前,半导体行业就已预见摩尔定律触及物理极限——当制程微缩难以持续推高单芯片算力时,业界转而通过增加芯片数量、扩大集群规模来延续算力增长格局。

但到了AI时代,新的问题又出现了:AI大模型的并行计算对卡间通信时延极为敏感,单纯的“堆芯片”同样会遇到瓶颈。

就像韩信点兵,“多多益善”的前提是指挥体系能同步调动每一路兵马,否则兵越多,弱点越多。

Kimi K3推荐底座之一——英伟达NVL72,正是为此而生。它通过NVLink五代技术,将72张英伟达高算力GPU焊入同一机柜,构建一个低时延、高带宽的一致性计算域,突破多卡协同中的通信瓶颈。

当然,NVL72仍然是一个非常“娇气”的算力架构。它不能无限扩展其集群,因为单机柜供电有上限,因为卡间要有散热空间,也因为铜线高保真低延迟传输有物理长度限制。

从原理上,GPU 之间要协同工作,最基本的需求是能互相读取缓存空间的数据。但是在微观尺度上,跨卡的数据读取与本卡写入数据会因为传输延迟产生致命冲突。

就像古代行军打仗,“将在外,君命有所不受”,因为战场形势的变化远快于指挥命令的下达。

为了实现GPU跨卡计算,英伟达NVLink配套了一套复杂的硬件机制。这套机制的核心是一颗专门的交换机芯片“NVSwitch”:它的内部维护着一张表格,记录着每张 GPU 的缓存里有哪些数据、状态如何(干净的、脏的、无效的),它可以向所有GPU广播“无效”通知。

用专业的叫法,这叫“缓存一致性”。但之所以它又很“娇气”,是因为从GPU发出读写请求,到NVSwitch转发无效通知,到所有 GPU 确认收到,整个往返必须在极短时间内完成。如果某个 GPU 迟迟收不到通知,它就可能拿着旧数据继续计算,进而造成错误。

因此,为了实现具有“强缓存一致性”的GPU互联,NVL72机柜不得不选择在内部使用铜线互联。

铜线的优点是低延迟、高保真,契合短距离算力集群的通信需求。当然,铜线也有缺点。NVLink 5 的信号速率高达每秒 1120 亿次变化,而高频信号在铜线里跑超过 2 米,信号质量就会差到无法可靠识别。所以NVL72机柜的5000多条铜缆全都被限制在2米以内,NVLink并行GPU的数量,也会受到物理空间和通信延迟极限的双重约束,被控制在非常有限的范围内。

“超节点”的中国解决方案

既然铜缆传输有空间限制,那为什么不用光纤呢?这可能是理解算力集群工作原理之后,第一个冒出来的问题。

光纤具备长距离稳定传输的优势——但芯片只能处理电信号,光电转换本身会引入额外延迟。而在NVLink强缓存一致性架构下,从GPU发出写请求到所有GPU确认收到无效通知,整个往返必须控制在1.5微秒以内。因此,铜线在2米内的传播延迟仅约20纳秒,且无需转换;而光纤方案会面临更高的成本、更大的功耗和更复杂的系统设计。

因此,英伟达等厂商最终选择了“铜光互联”的分层策略:机柜内部走铜线,利用其低延迟满足强一致需求;机柜之间或跨机房通信则切换为光纤,光纤的长距离优势在此发挥作用。

选择以上策略,是受限于英伟达GPU自身已然成型的架构——但若从底层架构上就和英伟达GPU、NVLink等设计思路区分开,更广泛的集群光通信,反而变成了一种可选方案。

以华为的算力芯片NPU,以及其推出的集群连接方案灵衢 UB为例:

在芯片端,华为把光引擎直接集成在NPU封装旁边,而不是像传统方案那样外挂一个可插拔的光模块。这就好比电梯入户,甚至是“地铁入户”,省去了通勤短驳带来的延迟。

而在协议层,华为放弃了英伟达那种“写下去,全世界立刻知道”的强一致缓存语义,改用了“最终一致”。

这是什么意思呢?从微观尺度来看,如果NPU-A写了一块地址X的数据,NPU-B可能在短时间内还会读到旧值,但协议保证“最终”B能看到新值。中间这段时间,软件自己负责处理。

这就像一个单位的文件流转制度:不是每份文件签署后立即传真给所有部门,而是每天下班前统一归档,各部门第二天上班时从档案室调阅最新版本。它的时效性比实时同步低一点,但系统可以做得很大、覆盖范围可以很广。

由于在芯片近端便使用了光通信作为传输介质,中国算力可以横跨多个机柜,组成一个相对低延迟、高带宽的一致性通信域——这也就是华为可以部署高达128个计算柜、32个互联柜、8192个NPU体量的“超节点”的原因。

埋下超越英伟达的可能

那么为什么说这次不仅是Kimi的高光时刻,更是国产算力的高光时刻?

原因藏在Kimi K3随模型披露的技术博客中。

K3模型的参数总数高达2.8万亿,其无疑需要更大规模的多卡协同才能实现模型的加载。

同时,在推理架构上,K3采用了国产模型普遍使用的MoE(混合专家模型)。不过,K3采用的专家数量首次提升至896个。也就是说,K3首次引入了早前还在学术论文中的“WideEP”——即“大规模专家并行”的结构。

具体怎么做呢?在K3的模型算力部署端,896个专家会被平均部署到64张算力卡上,每张卡恰好对应14个专家;这个算力架构要求集群内部具备低时延、高带宽的特点,因此只有包括华为、英伟达在内的“一柜多卡”超级算力集群,才能承接这样的配置需求。

鉴于此,K3才会特地把“64卡及以上超节点”写进官方推荐配置。

但是,英伟达NVL72本身的延展性,无疑受限于铜互联的物理极限。

我们不妨假设一个场景。未来,Kimi或其他国产模型厂商发布了更多基于“大规模专家并行”策略的模型,专家数量、算卡数量需求开始“指数级增长”,那么即便英伟达拥有高带宽的优势,其单域规模上限的劣势,却会被“大规模专家并行”的架构放大。

反倒是国产算力,从算力芯片设计之初,到集群架构总体设计,早就完成了与国产模型工程架构的适配与互补。“大规模专家并行”与“超节点”,反而成了反超海外AI前沿配套的黄金搭档。

国产算力集群固然有其短板,如单卡带宽低、数据同步有延迟。但在“大规模专家并行”策略中,这些问题恰好不那么尖锐。其原因有两条:一是K3的专家权重是固定的,在推理任务时不涉及修改,不需要卡间实时同步;二是K3的缓存数据要么是只读的旧内容,要么是每步新增的新内容,不存在两张卡同时改同一份数据的情况。所以华为用“同步稍慢”换取“域更大、跨机柜”的架构,反而成了K3这种模型最适合的底座。

此外,Kimi K3的种种架构创新,如创新的注意力机制KDA、分发机制Stable Latent MoE等,都体现出对国产算力“单卡不足,集群来补”特点的适应性。

而K3的跑分登顶,恰恰证明了“大规模专家并行”策略的优越性,也进而证明国产算力“超节点”真的可以跑前沿模型。

当然,“超节点”并非毫无缺点——华为NPU的算力相比英伟达GPU仍有差距。这意味着通过堆叠更多机柜构建的超节点,其功耗往往要超过提供同等算力的NVL72。但是,中国在发电量和电网配置能力上有优势,超节点的功耗和成本问题可以被这些优势所弥补。

与此同时,中国在算力设施的基础能力上,拥有更强的光通信产业化基础。这也令以光通信作为主流通信介质的超节点架构非常契合国内的优势产业。

Kimi K3的发布被许多人理解为“DeepSeek时刻”的2.0再现。但是,从算力适配的角度看,K3的发布其实更接近“国产算力1.0时刻”。


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
历史重演!继樊振东后,林诗栋夺冠队友不敢鼓掌,教练阴沉着脸,话题冲上热搜遭热议

历史重演!继樊振东后,林诗栋夺冠队友不敢鼓掌,教练阴沉着脸,话题冲上热搜遭热议

李晚书
2026-09-29 15:37:39
本田新车上市:18.48万起,价格有点香啊

本田新车上市:18.48万起,价格有点香啊

科技堡垒
2026-09-29 10:23:08
提速10.7倍!这个端侧推理引擎一开源,机器人本体跑大模型终于不卡了

提速10.7倍!这个端侧推理引擎一开源,机器人本体跑大模型终于不卡了

机器之心Pro
2026-09-29 15:11:52
油价调整通知:受国际油价大跌的影响,汽柴油价格将会重新下跌0.11元/升-0.14元/升

油价调整通知:受国际油价大跌的影响,汽柴油价格将会重新下跌0.11元/升-0.14元/升

台州交通广播
2026-09-29 07:40:02
举报带来的道德崩坏,在网上炸开了!

举报带来的道德崩坏,在网上炸开了!

新动察
2026-09-29 15:16:40
詹姆斯自曝本想签尼克斯!纽约夺冠后只能作罢:媒体绝对不会接受

詹姆斯自曝本想签尼克斯!纽约夺冠后只能作罢:媒体绝对不会接受

罗说NBA
2026-09-29 07:45:59
又美又飒,0.09秒优势摘桂,小孩姐最后一棒生吃泰国选手,亚运3金1银,球迷建议担任闭幕旗手

又美又飒,0.09秒优势摘桂,小孩姐最后一棒生吃泰国选手,亚运3金1银,球迷建议担任闭幕旗手

我就是一个说球的
2026-09-29 20:54:43
真相来了,裴轶被盯住的原因终于找出来了!

真相来了,裴轶被盯住的原因终于找出来了!

叒女紫121
2026-09-29 11:36:51
北京理工大学通报:裴某存在严重违反教师职业道德规范和行为准则等行为,已解除聘用关系

北京理工大学通报:裴某存在严重违反教师职业道德规范和行为准则等行为,已解除聘用关系

每日经济新闻
2026-09-29 19:04:05
水谷隼:中国男乒过去像王楚钦一样的选手有五六个,如今只依赖他一人

水谷隼:中国男乒过去像王楚钦一样的选手有五六个,如今只依赖他一人

观察者网
2026-09-29 20:17:07
坚决反对删除“敌国条款”,中国代表两问日方

坚决反对删除“敌国条款”,中国代表两问日方

澎湃新闻
2026-09-29 15:16:59
夺冠后细心叠好国旗!陈妤颉被日媒调侃“奶奶跑”?实力打脸所有质疑

夺冠后细心叠好国旗!陈妤颉被日媒调侃“奶奶跑”?实力打脸所有质疑

刀锋体育
2026-09-29 10:41:16
房东称一母亲将12岁男孩独留出租房,拖欠租金和管理费超7万元 街道正牵头研究处置方案

房东称一母亲将12岁男孩独留出租房,拖欠租金和管理费超7万元 街道正牵头研究处置方案

红星新闻
2026-09-29 17:28:22
陈妤颉最后一棒逆转泰国!亚运100米混接中国夺冠,汶颂无缘第3金

陈妤颉最后一棒逆转泰国!亚运100米混接中国夺冠,汶颂无缘第3金

球场没跑道
2026-09-29 20:31:22
赌王四房婚礼,何超琼带三房成员现身,奚梦瑶父母给女儿争光了

赌王四房婚礼,何超琼带三房成员现身,奚梦瑶父母给女儿争光了

阿讯说天下
2026-09-29 15:47:30
美国将建最大钢铁厂 特朗普:总不能向中国要!

美国将建最大钢铁厂 特朗普:总不能向中国要!

看看新闻Knews
2026-09-29 16:32:48
中纪委再次放话!严令各地哪怕掉层皮,也要一抓到底!

中纪委再次放话!严令各地哪怕掉层皮,也要一抓到底!

职场资深秘书
2026-09-29 17:39:47
乌克兰单日歼敌超2000人创历史新高,俄军在利曼成建制投降

乌克兰单日歼敌超2000人创历史新高,俄军在利曼成建制投降

东方豪侠
2026-09-29 17:20:48
中国加大对精英富裕阶层的税收征管力度

中国加大对精英富裕阶层的税收征管力度

风向观察
2026-09-29 11:19:00
烟草行业到底有多惨?网传中华烟开始打8.8折销售...

烟草行业到底有多惨?网传中华烟开始打8.8折销售...

慧翔百科
2026-09-29 12:08:11
2026-09-29 22:47:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4928830文章数 9696关注度
往期回顾 全部

科技要闻

82亿美元收购!李飞飞将与苏姿丰并肩做AI

头条要闻

"将儿子独留出租房"母亲质问房东:你的目的是为了什么

头条要闻

"将儿子独留出租房"母亲质问房东:你的目的是为了什么

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

央行调整完善若干货币政策工具

汽车要闻

搭华为乾崑ADS 5/设计风格换新 2027款纵横G700售30.49万起

态度原创

房产
家居
亲子
游戏
公开课

房产要闻

山海悦·壹号院喜封金顶 第五代住宅重塑自贸港人居新标杆

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

工程车小故事 :分西瓜

《巫师3》闲鱼代领火了!一份游戏30元 不怕Ban机?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版