网易首页 > 网易号 > 正文 申请入驻

昇腾七年:一部中国AI芯片的系统重构史

0
分享至

故事要从2018年说起。

那年10月,华为在全联接大会上第一次公开了昇腾310和昇腾910。当时公布的指标确实吓人:FP16算力256 TFLOPS,INT8算力512 TOPS,最大功耗310W。


图1 昇腾产品与系统演进主线

2019年8月23号,910正式发布,MindSpore同天推出。

但我觉得比"全球最强"更值得关注的,是华为选了一条跟英伟达完全不同的路。

英伟达走的是GPU路线。GPU天生是做图形渲染的,后来发现也能跑AI计算,就一路改改改成了今天的AI加速器。

华为没有走这条"改"的路。达芬奇架构从一开始就是为AI计算长的。

芯片里同时配了矩阵、向量、标量三种计算单元,然后用片上缓存、数据搬运和任务调度让它们一起干活。

Cube单元负责密集的矩阵乘加。

Vector单元处理激活函数和归一化。

Scalar单元管控制和地址逻辑。

真正难的不是把每种单元做多强,而是让数据在正确的时间抵达正确的计算单元。

说白了——哦不对,坦率的讲:AI加速器首先是一台数据搬运机器,然后才是一台算术机器。

这也是为什么910一定要和MindSpore同一天发布。

硬件划了能力边界,但编译器和算子库才真正决定你的模型能不能跑起来、跑多快。

后来不断迭代的CANN承担了类似「操作系统」的角色,向上对接框架,向下管理算子、内存、调度和通信。


图2 达芬奇架构的抽象工作链

然后2020年来了。

这一年发生的事,大家多少都知道。

美国对华为的出口管制全面收紧。设计完成的芯片没法流片,所有的路线图都被打断了。

网上很多人喜欢说「910的7nm工艺一夜之间成了泡影」。

这个说法听起来很悲壮,但不算准确。

更准确的说法是:原来的供应模式被切断了,后续产品必须在可获得的制造条件下,重新平衡性能、面积、功耗和产能。

流片、良率、封装、HBM、基板、测试。任何一环中断,路线图就废了。

这就是910B出现的原因。

华为从来没像发布910那样完整公开过910B的规格,工艺节点、量产细节都是保密的。

可以确认的是,910B在2023年前后成为了昇腾大模型算力的主力。

它的意义不是创造了什么新的峰值。

它的意义是恢复并扩大了可交付的训练和推理能力。就这么简单。

但还有一个很多人没注意到的点。

当制程红利被锁死,软件优化的价值会突然变得特别大。

算子融合可以减少中间结果回写内存。更好的切分能提高Cube利用率。

通信库优化能减少多卡同步等待。

这些说起来轻巧,实际上每一条都得靠大把工程师死磕。

不过我也必须说一句大实话。

CUDA的壁垒不是编程接口本身,而是它积累了几十年的算子库、框架、调试工具、社区代码和人才惯性。

CANN和MindSpore要面对的,不只是「能不能运行」,还包括「跑起来数值对不对」「长尾算子能不能覆盖」「性能能不能稳定复现」「出了问题能不能快速定位」。

这几个问题,任何一个都够吃好几年。

到了2025年,910C开始大规模部署。

这时候华为的路线发生了一个很有意思的变化。

多家媒体和分析机构把910C描述成双计算Die方案——就是把两颗上一代的芯粒通过先进封装整合在一起。

Chiplet不是把两颗芯片粘在一起就完事了。

芯粒之间的通信延迟、封装面积、功耗密度、HBM布线、良率组合、软件对非均匀访存的处理——每一条都是要还的债。

只有当封装互联、内存系统和调度软件一起搞定,双Die才能接近「一颗更大芯片」的使用体验。

但910C最大的价值不在这里。

它释放了一个重要信号:华为开始把单芯片的制造约束,转化成封装和系统设计的问题。

它未必在所有任务上都等价于同时代的顶级GPU。但它为后面的一切铺了路。

2025年3月,华为推出了Atlas 900 A3 SuperPoD。华为云在这上面提供CloudMatrix 384实例。

满配384颗NPU协同工作,FP16算力300 PFLOPS级别,片上内存48TB,D2D双向带宽784GB/s。

我第一眼看到384 NPU这个数字的时候,第一反应也是:所以这是384台八卡服务器?

不是。

384颗NPU就是384颗NPU。不是384乘以8。


图3 超节点的系统构成

传统集群的玩法是先在一台服务器里做高速互联,再通过网络连很多台服务器。但这里有两个概念:Scale-up追求更低时延、更高带宽、更统一的资源视图。Scale-out追求往外扩展到更多机柜。

华为「超节点」的方向是把Scale-up的边界从一台服务器推到多机柜。

让几百颗NPU在逻辑上更像一台大机器。

大模型训练最怕的不是某张卡不够快。

是木桶效应。

张量并行、流水并行、数据并行、专家并行——这些并行的方式会持续制造通信。

某条链路拥塞了,某张卡降速了,某个节点故障了,其他所有设备都得等着。

规模越大,检查点保存、故障恢复和长稳运行的重要性甚至超过单卡峰值。

我自己做AI这块也踩过类似坑。

单卡跑demo的时候一切都好,一上集群就开始各种莫名其妙的慢。网络拓扑、通信策略、负载均衡——这些在单卡场景下根本不用考虑的问题,到了集群就是噩梦。

华为384超节点遇到的也一定是同样的问题,只是规模大了几百倍。

然后就是我们今天最关心的产品了。

2025年9月,华为第一次公开了未来三年的路线图。

950PR计划2026年一季度推出,950DT四季度,然后是2027年的960和2028年的970。

950PR和950DT用的是同一个Ascend 950 Die。

但面向的工作负载不同,配的内存和互联也不同。

共同的目标峰值是FP8 1 PFLOPS、FP4 2 PFLOPS。

但我得说一句,这个数字必须跟数据格式、稀疏性、板卡功耗一起看,不能直接等同H100或者其他GPU的端到端性能。


图4 Prefill与Decode的资源特征

来说说这两款芯片的分工。

950PR首先面向大模型Prefill阶段和互联网推荐业务。

配的是HiBL 1.0 HBM,目标128GB容量、1.6TB/s带宽。2026年3月搭载950PR的Atlas 350加速卡已经公开亮相了。

Prefill阶段要处理比较长的输入序列,矩阵运算密度高,更容易把计算单元喂饱。

推荐系统也是一样,大量Embedding查找、特征交互、批量推理,对容量和访问粒度有自己的要求。

950DT则是面向训练和Decode阶段。

配的是HiZQ 2.0 HBM,目标144GB容量、4TB/s带宽。

芯片总互联带宽2TB/s。原生支持FP8、MXFP8、MXFP4和HiF8。

看到这里你可能觉得:挺好的,一个die配两种内存,降低成本嘛。

但我不这么看。

这更像是一次「分型」。计算密集的场景和带宽密集的场景,对硬件的需求是完全不同的。

用一个统一方案去覆盖两种场景,一定会有妥协。950直接一刀切开,各自优化。

至于FP8和FP4,我必须多说一句。

低精度确实能提高吞吐、降低显存占用。

但它不是免费的。能不能保持模型精度,取决于数值格式、缩放策略、累加精度、量化感知训练、算子实现。一串很长的链条。

厂商公布的FP4峰值更适合说明硬件上限,不能说明你的模型在同等质量下能白捡两倍性能。

然后说集群。

华为路线图里Atlas 950 SuperPoD的满配目标是8192张基于950DT的卡。

注意是8192张卡,不是8192个节点。

满配系统包括128个计算柜和32个互联柜,FP8总峰值8 EFLOPS,FP4总峰值16 EFLOPS。计划2026年四季度上市。

就在前几天,2026年7月的世界人工智能大会上,华为第一次线下展示了Atlas 950 SuperPoD的真机。是1024卡配置。

你猜怎么着。

1024卡这个阶段性成果,已经达到1 EFLOPS FP8、2 EFLOPS FP4、256TB统一内存编址空间、3微秒级RTT时延。

从384卡到1024卡,再到8192卡。难点不是把端口数量放大21倍。是控制拓扑直径、拥塞、时钟同步、光互联成本、散热、电力和故障概率。

超节点越大,系统软件就越像真正的操作系统。它得管理全局资源,还得让上层框架不用关心每一次物理故障。

这让我想起来一件事。前段时间我写文章的时候查资料,发现很多人在说「用系统创新弥补制程差距」。

这句话本身没错,但容易被理解成「芯片落后点也没关系」。

不是这样的。

系统创新消除不了所有代价。更多芯片意味着更高的总功耗、更大的机房面积、更多的光模块和交换设备、更复杂的运维。如果单卡性能、能效或者良率确实有差距,系统必须用更多的资源去抵消。

反过来也一样。先进制程也不会自动给你一个可用的AI系统。HBM、先进封装、高速互联、液冷、电源、编译器、通信库——今天所有领先的公司都在把这些要素当成战场的中心。

昇腾只是被外部约束逼着更早、更激进地做了这件事。

最后聊聊生态。

很多人说昇腾缺生态。

这话对,但不全对。

昇腾软件生态要解决的问题分三层。

第一层是兼容。主流框架、模型、算子能跑。

第二层是性能。同一个模型在目标精度下有可预测的吞吐和时延。

第三层是工程效率。开发者能定位问题、做性能剖析、管理集群、复用社区成果。

截至2026年7月,CANN开源社区有67个项目、1244万行代码、月活开发者3500多人。昇腾384超节点累计部署超过750套。

这些数字说明生态在扩大。但它能不能形成长期壁垒,还得看开源治理质量、第三方贡献比例、框架上游合入速度、客户迁移后的总拥有成本。

对开发者来说,真正有价值的不是「国产替代」这四个字。

而是迁移之后能不能稳定升级。有没有足够多的高质量算子。性能能不能复现。遇到问题的时候有没有透明的工具链和知识库。

如果这些都能做到,不用喊国产替代,开发者自己就会来。

所以回顾昇腾从910到950的这七年,我觉得最值得说的不是某个参数有多高,而是这个团队一直在换解题思路。

910确立了面向AI的达芬奇架构和全栈起点。

910B在供应链被打乱之后,扛起了产品连续性的担子。

910C用多Die和先进封装,把制造约束转化成了系统工程问题。

950更进一步,把内存、低精度和互联作为产品分型的核心。

如果一定要给这七年提炼一个关键词。

我觉得不是「追平」。

是「重构」。

重构芯片和内存的关系。

重构单卡和集群的边界。

重构硬件和软件的协同方式。

也重构中国AI产业对供应链风险的理解。

未来的胜负不会由一张参数表决定。

它会被更诚实的指标决定:

真实模型的端到端性能。

每Token的成本。

万卡规模的长期稳定可靠性。

以及开发者愿不愿意把下一代模型长期押在这个生态上。

这三件事,比发布会上的每一个数字都难。

但也比发布会上的每一个数字都重要。

注:本文信息综合自华为公开资料、Huawei Connect 2025技术报告、WAIC 2026公开信息及行业分析报告。所有芯片与系统性能均为厂商公开峰值或目标值,不同数据精度、稀疏性、功耗、批量大小、模型结构与软件版本下的指标不可直接等同。

AI重构EDA 技术大会(8月18日 上海) 欢迎报名参会


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
雷军说“晚安”被骂上热搜 小米高管直接用两字回敬

雷军说“晚安”被骂上热搜 小米高管直接用两字回敬

TechWeb
2026-08-02 09:58:04
知名女演员口部及嘴唇受伤,送医后缝了50多针,本人发文回应

知名女演员口部及嘴唇受伤,送医后缝了50多针,本人发文回应

韩小娱
2026-08-02 11:10:11
突发!41岁金像奖影后意外重伤,缝合超50针全面停工,丈夫紧急联络整形医生

突发!41岁金像奖影后意外重伤,缝合超50针全面停工,丈夫紧急联络整形医生

吉刻新闻
2026-08-01 20:45:28
交警再次提醒:误闯红灯后只需一个动作,可以从扣6分变成只扣1分

交警再次提醒:误闯红灯后只需一个动作,可以从扣6分变成只扣1分

今日观众
2026-07-30 03:00:03
一天5瓜!认罪、处罚、“做头发”事件另有玄机?一个比一个离谱

一天5瓜!认罪、处罚、“做头发”事件另有玄机?一个比一个离谱

手工制作阿歼
2026-08-02 09:19:16
北京连下六道指令,陕西硬抗整整四年,最高指示:让749局来

北京连下六道指令,陕西硬抗整整四年,最高指示:让749局来

小哥很OK
2026-01-30 15:25:18
美国对印尼表明,买不到中国的生产厂,而且由于你们的产业不达标、不符合要求,我们与日本也都无法投资

美国对印尼表明,买不到中国的生产厂,而且由于你们的产业不达标、不符合要求,我们与日本也都无法投资

橙色书卷
2026-07-29 22:44:45
篮协又出大昏招!宫鲁鸣紧急召回两大国手:杨舒予这次被坑惨了!

篮协又出大昏招!宫鲁鸣紧急召回两大国手:杨舒予这次被坑惨了!

篮球快餐车
2026-08-02 02:57:23
佛得角门将沃齐尼亚加盟智利球队科洛科洛生变,对方无法兑现2.7万美元月薪,墨西哥克雷塔罗送上一年百万美元合同展开争夺

佛得角门将沃齐尼亚加盟智利球队科洛科洛生变,对方无法兑现2.7万美元月薪,墨西哥克雷塔罗送上一年百万美元合同展开争夺

第一财经资讯
2026-08-01 19:16:25
宝妈以为孩子没情商,原来全网小朋友都这样:不谈感情 全是事情

宝妈以为孩子没情商,原来全网小朋友都这样:不谈感情 全是事情

一口娱乐
2026-08-02 10:04:46
赛里木湖景区收每人75元自驾服务费?博州交通运输局:环湖公路既不属于国道,也不属于县道;景区:前往温泉县不必途经景区,进景区须购票

赛里木湖景区收每人75元自驾服务费?博州交通运输局:环湖公路既不属于国道,也不属于县道;景区:前往温泉县不必途经景区,进景区须购票

新京报
2026-07-30 17:42:08
WNBA中国第一人:韩旭三分绝杀迎500分里程碑 轰17+6赛季新高险胜

WNBA中国第一人:韩旭三分绝杀迎500分里程碑 轰17+6赛季新高险胜

醉卧浮生
2026-08-02 07:57:42
房主任塌方,最无节操的是爱奇艺

房主任塌方,最无节操的是爱奇艺

不正确
2026-08-01 21:25:07
44 岁姚笛嘉兴夜市独自对瓶喝啤酒,当年全民追捧的甜妹只剩一身落寞

44 岁姚笛嘉兴夜市独自对瓶喝啤酒,当年全民追捧的甜妹只剩一身落寞

迪迪的娱乐故事
2026-08-01 15:14:33
男孩的“救命水杯”停产!全球网友翻箱倒柜,最后中国工厂出手了

男孩的“救命水杯”停产!全球网友翻箱倒柜,最后中国工厂出手了

北美省钱快报
2026-08-02 01:15:43
李小璐首度回应八年网暴:“做头发”梗根本不是那么回事,2018年就已离婚,延迟公开只为保护女儿

李小璐首度回应八年网暴:“做头发”梗根本不是那么回事,2018年就已离婚,延迟公开只为保护女儿

三湘都市报
2026-08-01 16:36:23
扛货媛也来了…

扛货媛也来了…

微微热评
2026-08-02 09:36:40
国际足联公布世界杯半决赛阿根廷2比1英格兰的裁判视角集锦,贝林厄姆赛后对裁判讲话曝光:判罚令人震惊,但祝你好运

国际足联公布世界杯半决赛阿根廷2比1英格兰的裁判视角集锦,贝林厄姆赛后对裁判讲话曝光:判罚令人震惊,但祝你好运

艳儿说电影
2026-08-01 17:06:34
三星堆又“逆天”了!考古队爆出猛料:挖出的竟不是地球之物

三星堆又“逆天”了!考古队爆出猛料:挖出的竟不是地球之物

网络易不易
2026-08-02 09:50:25
给富家少爷做家教有多扎心?网友:正常吃饭,他都以为是在省钱!

给富家少爷做家教有多扎心?网友:正常吃饭,他都以为是在省钱!

夜深爱杂谈
2026-08-01 21:20:03
2026-08-02 15:28:49
EETOP半导体社区 incentive-icons
EETOP半导体社区
国内著名的电子工程师社区
7991文章数 15695关注度
往期回顾 全部

科技要闻

零跑月销10万破纪录!比亚迪奇瑞海外卖爆

头条要闻

亲人车祸出院次日离世 未尸检就被火化遭保险公司拒赔

头条要闻

亲人车祸出院次日离世 未尸检就被火化遭保险公司拒赔

体育要闻

1米76的他,为什么是史上最强中卫之一?

娱乐要闻

一天5瓜!“做头发”事件另有玄机?

财经要闻

长鑫科技四万亿市值背后的资本与周期

汽车要闻

历史性里程碑时刻 零跑7月交付达101267台

态度原创

教育
时尚
亲子
艺术
房产

教育要闻

8月3日,中原科技学院2026年艺术高职(专科)批征集志愿开始填报

伊姐周六热推:电视剧《御廷谣》;电视剧《九门》......

亲子要闻

“我是健康小达人”儿童青少年健康科普暑期专场活动在京启动

艺术要闻

格里姆肖:月光下的乡间小路

房产要闻

1700亿砸下!信息量巨大!海南甩出又一个超级规划!

无障碍浏览 进入关怀版