华为这次最值得琢磨的,并不是又发布了一颗更快的AI芯片,而是准备把25.6万张卡组成一个更大的计算系统。更往前一步,Peerium甚至瞄准了百万级处理器协同工作。
单颗芯片暂时不是最强,就把几十万颗芯片“拧成一股绳”,这条路到底能不能跑通?更有意思的是,徐直军最新谈到昇腾时,已经把主要矛盾从“有没有客户”转向了“能不能供得上”。
当AI算力的竞争开始从一颗芯片扩大到整个数据中心,过去那套看芯片参数判断输赢的办法,可能真的有些不够用了。
![]()
一、单颗芯片还有差距,华为先把“比赛场地”放大了
9月17日,在华为全联接大会期间,华为正式公布Peerium计算架构。
按照华为给出的定义,这套架构通过嵌套并行、统一内存寻址和平等互联,希望让百万级处理器能够像一台更大的计算机一样协同运行。实现这件事的关键技术,就是灵衢UnifiedBus。
这个说法听起来很大,但真正值得关注的其实不是“百万”这个数字。
而是华为为什么越来越强调“很多颗芯片一起干活”。
原因并不复杂。
![]()
今天训练大模型,早就不是买几张高端加速卡插进服务器就够了。模型参数越来越多,上下文越来越长,真正到了大规模训练阶段,几千张、几万张卡一起工作已经很常见。
芯片数量一多,麻烦也跟着来了。
每张卡都要交换数据,模型参数需要同步,不同节点之间要通信。一部分处理器先算完,也不能自己往下跑,很多时候还得等别的处理器。
换句话说,集群越大,“交通堵塞”越容易成为问题。
这个时候,再单纯提高一颗芯片的峰值算力,效果就没有过去那么直接了。
![]()
发动机再强,路堵着,车还是跑不快。
所以华为眼下做的事情,可以理解成把竞争从“发动机”往“整条高速公路”上推。
今年7月公开亮相的Atlas 950 SuperPoD已经把这个思路做成了产品:单个超节点是1024卡,拥有256TB全局统一内存编址空间,提供1 EFLOPS FP8、2 EFLOPS FP4算力,依托TB级NPU互联超大带宽与3微秒超低RTT时延,突破集群内计算、存储等各类资源的通信瓶颈。
到了Peerium这一层,华为又披露,25.6万卡规模的Atlas 950 SuperCluster已经进入部署阶段。
这里要特别说清楚,25.6万卡不是塞进一个超节点,而是大量超节点进一步连接形成的超大集群。
![]()
这就很有意思了。
过去看AI芯片,市场喜欢比较谁的制程先进、单卡算力高、显存大。
现在华为希望市场再多看一层:一千颗芯片放到一起还能剩下多少有效算力?十万颗以后呢?
这并不是故意回避单芯片差距。
徐直军自己在近期交流中也没有遮掩这一点。他谈到海外客户时明确承认,昇腾与竞争对手相比仍有差距。问题在于,如果暂时不能只靠单颗芯片正面解决所有问题,系统工程就变得格外重要。
这也是中国AI算力产业目前一个很现实的选择。
![]()
先进芯片制造能力不可能一夜之间补齐,但模型公司的算力需求不会停下来等。
怎么办?一边继续补芯片本身,一边把互联、内存、光通信、集群调度一起往上提。
于是,原来容易被视为配角的技术,开始站到舞台中央。
这也是为什么灵衢的重要性可能并不低于某一代昇腾芯片。
按照华为的设计,它希望通过一套开放协议,把CPU、NPU、内存、SSD、网卡和交换机连接起来。
以前这些部件更像不同部门,各说各的话;现在要尽可能减少中间的协议转换,让数据少绕路。
说白了,就是卡多了以后,先想办法让大家少互相等。
![]()
这条路如果跑通,华为获得的并不仅仅是一个更大的集群。
它还会把竞争尺度拉大。
竞争对手需要面对的将不再是一张昇腾卡,而是一整套从计算芯片、互联、存储到光通信组成的系统。这恰好又碰到了华为比较特殊的地方:它不只做芯片,同时长期做通信、光网络、服务器和数据中心。
过去这些业务看起来分散,到AI基础设施时代,反而可以被重新拼在一起。
所以Peerium真正释放出来的信号,并不是“芯片已经不重要”。
恰恰相反。而是当单颗芯片越来越接近技术和成本边界以后,决定算力价值的东西开始往系统外扩。谁能把更多芯片真正用起来,谁手里的筹码就会增加。
![]()
二、份额刚有变化,华为碰到的新问题却是“有单没货”
比技术架构更耐人寻味的,是徐直军最近谈到市场时透露出的变化。
按照他的说法,在华为能够统计到的口径下,昇腾在中国市场的份额已经超过英伟达。
这个判断需要留一个边界。
徐直军同时承认,目前很难准确获得英伟达在中国市场的完整份额数据,因此不能简单把这句话理解成一份独立第三方机构给出的市场排名。相关媒体的报道也把它表述为“可统计口径下”。
但是,即便把这个口径收紧来看,变化仍然值得关注。
![]()
因为几年前谈国产AI芯片,市场最担心的问题还是:有人愿意用吗?
现在华为自己给出的答案是,最大的麻烦反而越来越像“供不上”。
徐直军谈到950DT时说得很直接。
950PR先面向推理市场,但目前上市量还不算大;用于训练的950DT超节点仍在测试,规模供货预计在今年年底或明年初。
真正值得注意的是他后面那层意思:往后影响昇腾推广的关键,可能已经不是推动力度,而是供应能力。
其原话是:“现在能产多少就供多少,我们希望产业链加快扩产,快一点、多产一点。”
这句话比很多漂亮的市场份额数字更能说明问题。
![]()
AI产业已经进入一个非常特殊的阶段。一边是模型公司拼命要算力,一边是芯片、HBM、光模块、先进封装乃至电力都开始紧张。因此真正限制AI基础设施放量的,已经不是一个环节。
徐直军甚至判断,全球AI相关产业真正走向供需平衡,可能要到2029年前后,中国可能还会更晚一些。这个判断当然属于企业管理层的预期,不是确定结果,但它至少说明,华为自己并不认为短期产能压力会很快过去。
这会带来一个很现实的变化。
过去国产AI芯片最大的挑战,是客户为什么不用。接下来更大的挑战可能变成,客户想用的时候能不能交货。这两种问题,看起来只差几个字,产业意义完全不同。
![]()
前一种意味着市场还没打开,后一种意味着订单机会已经出现,但供应链得跟上。这也是为什么华为目前对海外市场态度很克制。
徐直军表示,供应将以中国市场为主,海外只面向少数确有需求的客户。
不是海外没有需求,而是当前的算力产品连中国市场都还不能完全满足。
从中国AI产业的角度看,这其实把另一个问题推到了前台。
芯片自主化做到最后,从来不是一个企业单打独斗。
晶圆、存储、先进封装、光器件、电源、液冷、交换设备,任何一个地方卡住,大规模系统就很难真正铺开。
![]()
所以当华为说“能产多少供多少”时,表面谈的是昇腾,背后考验的其实是一整条产业链。
需求起来只是第一关。能够稳定、持续、大规模地把产品交出去,才是第二关。而第二关往往比第一关更难。
三、5厘米铜线换来近40%成本下降,华为算的不是参数账
如果说Peerium是在放大计算系统,那么华为选择NPO,则暴露出另外一种很典型的工程思维:
技术并不是越“极致”就一定越适合做生意。
目前高速光互联领域,CPO和NPO一直是两条受到关注的路线。
简单理解,CPO希望把光学器件贴得更近,尽可能和芯片深度封装;NPO没有走到这么极端,光引擎仍然保持一定独立性。
![]()
从距离来看,CPO当然更漂亮。
徐直军给过一个非常直观的比较:NPO保留大约5厘米的铜连接,而CPO大约可以做到5毫米。
一个5厘米,一个5毫米。
只看技术参数,好像答案已经出来了。
但华为最后偏偏选了前者,原因也很现实。
徐直军表示,按华为测算,相比CPO,NPO成本能够下降接近40%;更重要的是,光引擎坏了以后,不需要把整个AI芯片一起报废。
他同时强调,这并不是说CPO技术不行,两条路线本质上是在工程实现、成本、良率和维护之间做平衡。
![]()
这一点非常像制造业最熟悉的逻辑。
实验室里追求的是最好参数,真正大规模铺设备时,要算的是总账。
设备要买多少钱,坏一次损失多少,维修是不是方便,量产良率怎么样,跑三年以后还剩多少可用率。
AI集群规模一旦到几千、几万张卡,小概率故障都会变成日常事件。
这个时候,“方便维修”本身就是性能的一部分。
华为最新发布的Hi-ONE正好能说明这种思路。
![]()
这款NPO光引擎单个传输容量达到7.2T,是业界首个量产的NPO产品,也是唯一实现内置光源的NPO产品。用在昇腾960超节点后,华为称5500个Hi-ONE能够替代传统方案中约4.8万个800G光模块,整套系统功耗减少超过550千瓦,可用度达到99.8%。单个昇腾960超节点最高可以做到4096卡。
更关键的是,960本身也在提速。
华为最新披露,昇腾960DT预计在2027年第一季度就绪,比此前规划提前三个季度;960PR预计2027年第三季度就绪。华为还提出以后保持一年一代的演进节奏,2028年、2029年分别推进970和980。
把这些动作放在一起,华为的算盘其实已经比较清楚。
![]()
单芯片继续追,但不能只等单芯片,与此同时,把互联效率、统一内存、光模块数量、功耗和维护成本全部往下压。
最终比较的也不再是谁一张卡的宣传参数更漂亮,而是谁能够用更合理的成本,把一座数据中心真正跑起来。
这才是这轮AI基础设施竞争开始发生的微妙变化,英伟达原有的优势当然不会因此突然消失。
CUDA生态、领先GPU产品以及多年形成的开发者习惯,都不是一套新架构发布以后就能轻易改写的。
华为自己也在持续补软件这一课。CANN已经进入常态化开源运营,昇腾正在扩大对主流开源社区的支持。硬件能够连成一大片,软件如果不好用,最后仍然很难形成真正的规模优势。
所以现在还远不到宣布谁已经赢了的时候。
![]()
但旧格局确实出现了一个值得观察的松动。
以前AI算力市场很容易被简化成一道题:谁能拿到最先进的GPU?
现在题目正在变长。芯片从哪里来,几十万颗芯片怎么连接,数据怎样流动,光模块耗多少电,系统坏了怎么修,软件能不能迁移,最后每训练一个模型到底花多少钱——这些过去藏在后台的问题,正在一起走到前台。
华为眼下增加的筹码,也恰恰在这些地方。
25.6万卡能不能真正高效运行,950DT能否按计划规模交付,960提前之后能不能顺利量产,这些都还需要真实业务继续验证。
但如果几年之后回头看这一轮AI算力竞争,真正重要的转折点可能不是某一颗芯片跑出了多少分。
而是从这一阶段开始,行业越来越清楚了一件事:一颗芯片可以决定上限的一部分,但当算力进入十万卡、百万处理器时代,真正的大生意,已经是怎样把整座数据中心拧成一股绳。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.