深夜闭门交流,梁文锋对着投资人说出“华为超节点可完全平替英伟达GB200/GB300”时,这句话像一颗深水炸弹。但紧接着,他补了一句:“代价是,四张华为卡顶一张英伟达的卡,同时落后两年。”
这场“平替”不是替代,而是等价交换——用4倍硬件规模,换取相同的任务完成能力。我们掰开来看,它到底强在哪、差在哪。
强在哪:华为超节点的“光速”连接
梁文锋看中的,是华为超节点在互联架构上的杀手锏。英伟达的GB200/GB300虽强,但NVLink电互联天然受“距离诅咒”——铜缆超过2米信号就会严重衰减,导致单机柜GPU规模长期卡在72卡。
华为的解法是“以光代电”。其自研灵衢2.0全光互联协议,单跳时延低至200ns,支持1024卡跨节点统一内存编址,全局256TB内存可视为一个整体调度。这就像把一座城市上千个分散的仓库,用光纤直接连成一个巨型仓库,搬货时不用再绕路中转。
![]()
昇腾950超节点Atlas 950 SuperPoD展示机柜
这种架构优势,在训练万亿级MoE大模型时尤其致命。华为官方数据显示,1024卡华为超节点集群FP8算力可达1EFLOPS,能完成与英伟达GB300同等级的大模型训练任务。这意味着,在出口管制买不到高端英伟达卡的背景下,华为超节点是国内唯一能规模化落地的“并列项”。
差在哪:单卡性能的“硬伤”与4倍代价
“强”在系统架构,“差”在单芯片。受先进制程约束,昇腾950单卡算力仅为GB300的1/4。梁文锋给出明确换算:训练同等规模大模型,需要5万张GB300,对应20万张昇腾950。
![]()
![]()
昇腾950系列芯片支持的主要规格表
这4倍代价是实打实的。同等算力规模,华为超节点需要占用4倍的机房面积,消耗4倍的电力,配套4倍的散热系统。英伟达GB300 NVL72单机柜功耗约180kW,而华为同规模集群的功耗与占地必然大幅攀升。
尤其当GB300在1024卡规模下扩展效率仍高达98.5%时,华为超节点能否在更大规模集群中保持同等效率,目前尚无第三方公开验证数据。
梁文锋自己也承认,华为950生命周期会更短,“今年用挺好,明年用还可以,后面再用就太费电了”。
核心真相:卡在“产能”与“生态”的华为
这场“平替”争论的真正焦点,不是技术,而是落地。梁文锋直言,国产AI芯片唯一的问题是“产能不够”。DeepSeek通过合作拿到1.6万张昇腾950,但梁文锋说这“只相当于四千张B系列,不够训下一代模型”。
算力之外,还有生态。英伟达CUDA积累了十余年,覆盖全球开发者、第三方工具链。而梁文锋自研的TileLang编译器已绕开英伟达CUDA生态,但这是DeepSeek一家能做到的,不代表全行业都能快速迁移。
所以,梁文锋的“完全平替”是功能层面的等价表述,不是总拥有成本的低价方案。它更像一个“备选方案”:在高端英伟达卡被禁运的背景下,华为超节点用4倍硬件规模+2年技术代差,换来了一个“能用”的国产替代路径。
![]()
展会现场观众参观昇腾950超节点设备
而这道题最终能否解,不只看华为的芯片和互联技术,更看晶圆厂里能拉出多少片昇腾950。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.