网易首页

注册免费邮箱

网易首页 > 网易号 > 正文申请入驻

英伟达含量为零！华为密集模型比肩DeepSeek-R1，纯昇腾集群训练

2025-04-15 22:55:30　来源: 量子位

北京举报

0

分享至

克雷西发自凹非寺
量子位 | 公众号 QbitAI

密集模型的推理能力也能和DeepSeek-R1掰手腕了？

华为利用纯昇腾集群训练出的盘古Ultra，在数学竞赛、编程等推理任务当中，和R1打得有来有回。

关键是模型参数量只有135B，整个训练过程零英伟达含量，而且没有出现损失尖峰。

通过改进的模型架构和系统优化策略，盘古Ultra拥有优异的性能表现和52%以上的算力利用率。

并且有网友表示，训练过程中没有出现损失尖峰这一特征，似乎此前从未实现。

135B密集模型比肩DeepSeek-R1

作为一个参数量135B密集模型，盘古Ultra达到了同尺度密集模型的最优表现，甚至可以与DeepSeek-R1等参数量更大的MoE模型竞争。

在预训练阶段模型的评测中，盘古Ultra在绝大部分英文基准任务和全部中文任务上取得了最佳性能，优于Llama 405B、DeepSeek-V3等baseline模型。

尤其在MMLU、TriviaQA、GSM8K等具有挑战性的数据集上，盘古Ultra展现出了卓越的语言理解和推理能力。

经过指令调优后，盘古Ultra的性能进一步提升，尤其在AIME 2024、MATH-500等数学推理任务和LiveCodeBench等编程竞赛题上达到了SOTA水平。

综合来看，盘古Ultra超越了包括GPT-4o、Mistral-Large 2等强大模型，与DeepSeek-R1等MoE模型竞争激烈。

同时，盘古Ultra在Arena Hard、MMLU-pro等涵盖通用语言理解和推理的评测中也表现优异。

那么，为了实现这样的效果，盘古Ultra采用了哪些关键技术呢？

“三明治”层归一化架构

如前文所述，盘古Ultra是一款135B参数量的密集模型，使用了94层的网络结构。

盘古Ultra采用了分组查询注意力（GQA）机制，包含96个查询头（query head）和8个键值头（key-value head）。

为了解决训练超深网络面临的不稳定性和收敛困难等问题，盘古Ultra在模型架构上做出了两个关键改进——深度缩放的Sandwich-Norm层归一化和TinyInit参数初始化策略。

传统的Transformer通常使用Pre-LN层归一化，但在深度模型中，Pre-LN容易导致每个子层输出尺度的波动，引发训练不稳定。

盘古Ultra使用的Sandwich-Norm层归一化，则是在残差连接前对每个子层的输出做归一化，并根据网络深度对初始化值进行缩放，从而有效消除了训练过程中的loss尖峰，使训练过程更加平稳。

用更容易理解的话说，传统方法仅在每个子层的输入进行归一化，但这种方法针对输出也进行了归一化，形成了Pre-Norm + 子层 + Post-Norm的“三明治”结构。

但是，仅仅使用Sandwich-Norm还不足以完全消除深度模型训练中的不稳定性——随着网络层数的增加，每一层的输出尺度仍然可能出现累积性的漂移。

为此，盘古Ultra在Sandwich-Norm的基础上，进一步引入了深度缩放机制，对Post-Norm中的放缩参数γ进行了深度相关的初始化。

至于整个模型的初始化，传统的初始化通常采用的Xavier初始化方法仅考虑模型宽度，而盘古Ultra采用的TinyInit同时依据模型深度和宽度来缩放初始化权重的标准差。

这种初始化方式有助于在前向传播和反向传播过程中，维持各层梯度的方差在一个合理的范围内，避免了梯度消失或爆炸问题，使得训练过程更加稳定，同时也加速了收敛。

实验表明，TinyInit在深度模型训练中取得了更好的收敛速度和下游任务性能；同时针对embedding层，保持权重的标准差接近1也能提升训练稳定性。

另外，盘古团队也针对Tokenizer进行了优化，通过在通用中英文、代码、数学等不同领域分别进行词频统计，再合并去重，最终得到了一个兼顾领域覆盖和编码效率的153376个token的平衡词表。

8192张昇腾NPU训练集群

盘古Ultra的整个训练流程主要分为三个阶段——预训练、长上下文扩展和指令调优。

其中预训练又可以分为三个子阶段：

通用阶段：侧重建立语言理解和知识储备，使用了大量中英文通用语料，覆盖网页、书籍、百科等多个来源；
推理阶段：引入更多高质量的数学和代码数据，以增强模型的推理能力。同时还使用instruction数据来帮助模型学习执行任务；
退火阶段：帮助模型巩固知识和推理能力，并强化指令遵循能力。大量使用问答对和人类反馈数据。

研究者们采用了基于规则和模型的数据清洗方法，并设计了curriculum learning策略，让模型循序渐进地学习不同难度的样本。

预训练中使用了AdamW优化器，并动态调整超参数。

预训练后，模型在最长128K的长上下文数据上进一步训练，通过扩大RoPE的基频来实现长序列建模，以增强处理长文档的能力。

最后的指令调优阶则段使用监督微调（SFT）和强化学习（RL）来使模型更好地适应下游任务，学会执行指令并与人类偏好对齐。

训练设施方面，盘古Ultra使用了一个由8192个昇腾AI处理器组成的大规模计算集群。

集群中每个节点包含8个NPU，通过华为高速缓存一致性互联HCCS以全互联的拓扑结构连接，每个NPU配备64GB内存，节点间则通过200Gbps的RoCE（RDMA over Converged Ethernet）网络互联。

为了实现盘古Ultra的高效训练，研究团队还采用了一套系统的并行策略和优化技术。

在并行策略的选择上，盘古Ultra综合考虑了模型的规模、数据的特性以及硬件的拓扑，最终采用了数据并行、张量并行、序列并行和流水线并行等多种并行方式的组合：

128路数据并行，将训练数据分片到不同设备，保证了数据吞吐；
8路张量并行，利用设备内部高带宽切分层内张量，实现高效通信；
序列并行用于处理超长序列以降低显存压力；
8段流水线并行，将不同层分布到不同设备，形成高效的计算流水线。

在并行策略的基础上，盘古Ultra还从多个角度对训练系统进行了深度优化。

一方面，通过使用ZeRO（Zero Redundancy Optimizer）分布式优化器，将模型状态分片到不同设备，大幅降低了单个设备的内存占用，在提高数据并行度的同时，确保了每个设备的内存负担在可接受范围内。

另一方面，研究者们通过各种通信和计算优化技术，最小化了通信开销，提升了计算效率：

通过算子融合（Kernel Fusion）将多个小算子合并，减少了内存访问和kernel启动；
通过通信计算重叠（Communication-Computation Overlapping）实现通信和计算的深度交织，隐藏通信延迟；
MC^2（Merged Computation & Communication）和BOA（Batch Optimization Accelerator）分别对张量并行和规范化层的通信进行了专门优化……

在算法、工程、数据各个层面的精细优化下，盘古Ultra实现了52%以上的算力利用率。

技术报告：
https://github.com/pangu-tech/pangu-ultra/blob/main/pangu-ultra-report.pdf

特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐

热点推荐

英伟达革了自己的命:智能体进化7天,干掉所有算子工程师、GPU专家

机器之心Pro 2026-03-26 11:35:16
0 跟贴 0
DeepSeek急招Agent方向！一口气放17个岗位，重度Vibe Coding优先

量子位 2026-03-25 14:39:45
5 跟贴 5

谷歌新论文把内存股价干崩了！KV cache压缩6倍

量子位 2026-03-26 12:49:57
0 跟贴 0

谷歌新论文证明LLM可以少吃80%内存，闪迪盘中跌去50亿美元

DeepTech深科技 2026-03-26 13:26:34
0 跟贴 0
硅谷因AI大裁员？一线工程师戳破真相

每日经济新闻 2026-03-25 20:38:08
42 跟贴 42

同样用AI，为什么有的人用得更好？Anthropic新报告揭秘

智东西 2026-03-25 19:58:30
1 跟贴 1

谷歌推出压缩算法TurboQuant 宣称实现约6倍内存节省

财联社 2026-03-26 10:42:12
45 跟贴 45
多模态预训练，才是大模型的下一条路？Yann LeCun、谢赛宁参与

机器之心Pro 2026-03-09 11:53:58
0 跟贴 0

这个AI能自己造AI，十几分钟写完代码，一天交付可用模型

DeepTech深科技 2026-03-26 13:20:36
0 跟贴 0
支持远程操控和通用GUI操作3

机器之心Pro 2026-03-02 13:36:13
0 跟贴 0
三维空间太难懂？2

机器之心Pro 2025-12-31 13:49:19
0 跟贴 0
「被动感知」到「理解接触」！它石智航重磅发布OmniVTA视触觉世界模型

新智元 2026-03-26 09:20:41
0 跟贴 0
AI科学家登上Nature，论文从构思到发表全自动化，一篇已通过评审

DeepTech深科技 2026-03-26 13:21:22
0 跟贴 0
行业最大规模具身数据集：10Kh RealOmni-Open DataSet

量子位 2026-01-06 10:53:25
0 跟贴 0
行业最大规模具身数据集！出自简智机器人GenRobot.AI

量子位 2026-01-05 17:11:41
0 跟贴 0
每经专访高通全球高级副总裁钱堃：6G实现商业化应用需跨越四个挑战将重塑 AI 的发展方式

每日经济新闻 2026-03-26 12:53:06
0 跟贴 0
90后“稚晖君”，任上纬新材董事长！他是原华为天才少年

每日经济新闻 2025-11-26 14:49:35
1 跟贴 1
《极限竞速：地平线6》配置要求公布

IT之家 2026-03-26 08:21:43
2 跟贴 2
华为给Mate80装风扇，8499元起还便宜500元，这步棋你看懂了吗？

万大叔来了 2026-03-25 19:05:15
10 跟贴 10
深圳最狠的地方：每隔十年，就亲手“杀死”自己一次

饭统戴老板 2026-01-09 17:54:56
0 跟贴 0
用两年都不卡，华为手机怎么做到的？

爱范儿 2025-12-26 19:10:05
0 跟贴 0
探店｜3月17日开启交付，岚图泰山Ultra首搭华为896线激光雷达

映璇auto工作室 2026-03-24 23:15:53
0 跟贴 0
千亿Momenta赴港，车企自研会吃掉第三方吗？

i黑马 2026-03-26 11:16:53
0 跟贴 0
启境奕境双剑合璧，华为乾崑生态的高端棋局落子有声

CAR路里 2026-03-24 17:35:44
6 跟贴 6
女子分享老公超级干净的手机

晓星懂天下 2026-03-25 05:17:43
0 跟贴 0
英伟达将H100芯片发射上天，「太空数据中心点燃AI新战场

青年观察所 2026-03-24 09:50:31
3 跟贴 3
启境、奕境双“境”协同，华为乾崑又有新布局

燕赵女司机 2026-03-24 13:29:15
6 跟贴 6
黄仁勋：我也讨厌AI slop，但DLSS 5不是

闪存猎手 2026-03-26 11:58:04
1 跟贴 1
预计将于4月发布！新款华为Pura X新增型格橙、紫色

VDGER唯界 2026-03-24 22:56:47
0 跟贴 0
黄仁勋罕见谈生死：希望在工作中突然离世

i黑马 2026-03-26 09:24:35
0 跟贴 0
豪华家用两不误，华为乾崑保驾护航，到店体验岚图梦想家

车视界科技 2026-03-25 10:06:20
1 跟贴 1
华为畅享 90系列：麒麟8系芯片，华为史上最大电池！

宅数码Kael 2026-03-25 22:08:45
3 跟贴 3
华为三折叠开售日，现场没有现货，网友：不要玩合资车那套！

幽默制造厂 2026-03-25 15:07:32
1 跟贴 1
华为宣布手机全面回归，麒麟芯出货大幅提升

快科技 2026-03-25 05:45:39
0 跟贴 0
华为推出畅享90系列，仅1299元起

时代周报 2026-03-24 23:14:10
0 跟贴 0
3月23日直播剪影

龙凯锋瞰天下 2026-03-25 22:45:40
0 跟贴 0
华为FreeClip 2耳机斩获2026 iF设计奖

快科技 2026-03-26 08:56:27
0 跟贴 0
#展开说# 896线激光雷达上车，鸿蒙智行又断代领先了

速度计 2026-03-24 13:08:52
0 跟贴 0
越南选华为中兴建5G？这份硬核实力，美国网友都服了！

我一直在终点等你 2026-03-25 19:06:46
0 跟贴 0
那些整天说豪华还得是bba的，但凡一人买一辆，也不至如此

公干的搞笑社 2026-03-26 08:57:53
1 跟贴 1

上海男子爱上江西51岁老太，相差18岁恋爱九年不结婚

上海男子爱上江西51岁老太，相差18岁恋爱九年不结婚

浩舞纆画

2026-03-05 18:41:23

粟裕全歼张灵甫74师，毛主席听完战报沉默半晌：连我都没料到他敢这么打

粟裕全歼张灵甫74师，毛主席听完战报沉默半晌：连我都没料到他敢这么打

史海孤雁

2026-03-18 18:18:12

高市早苗称愿与中方对话，然后北京提了要求，日本上下都沉默了

高市早苗称愿与中方对话，然后北京提了要求，日本上下都沉默了

安安说

2026-03-25 11:00:02

马杜罗今天再次“出庭” 此前拒绝美方一切所谓“犯罪指控”

马杜罗今天再次“出庭” 此前拒绝美方一切所谓“犯罪指控”

闪电新闻

2026-03-26 10:21:04

江青作品惊艳！字写得灵动，秘诀竟在用笔！

江青作品惊艳！字写得灵动，秘诀竟在用笔！

书画相约

2026-03-19 09:15:49

美国隐瞒战死人数！美军炸了锅：不想为以色列而死

美国隐瞒战死人数！美军炸了锅：不想为以色列而死

涵豆说娱

2026-03-25 10:17:17

大伯突然给我发消息，让我赶紧卖掉房子，钱全部给堂弟，我问为啥

大伯突然给我发消息，让我赶紧卖掉房子，钱全部给堂弟，我问为啥

小秋情感说

2026-03-26 09:21:52

王晶曝陈百强真正死因，64岁何超琼颜面尽失

王晶曝陈百强真正死因，64岁何超琼颜面尽失

君笙的拂兮

2026-03-22 03:44:36

4、5、6月幸运连连的三个生肖，危机变转机，财富破土节节攀升

4、5、6月幸运连连的三个生肖，危机变转机，财富破土节节攀升

毅谈生肖

2026-03-26 11:47:20

兄弟俩联手创办苏宁，如今弟弟千亿资产清零，哥哥却走上另一条路

兄弟俩联手创办苏宁，如今弟弟千亿资产清零，哥哥却走上另一条路

鲸探所长

2026-03-24 14:38:04

揭开美国粮价低的真面目！他们骗人的鬼把戏终于被揭穿了！

揭开美国粮价低的真面目！他们骗人的鬼把戏终于被揭穿了！

老范谈史

2026-03-25 22:45:51

文班亚马惊天隔扣，马刺替补席惊呆了：这是外星人！

文班亚马惊天隔扣，马刺替补席惊呆了：这是外星人！

仰卧撑FTUer

2026-03-26 11:00:12

伊朗实力惊人，以方多个军事中心被炸，美以反应再次印证中国猜想

伊朗实力惊人，以方多个军事中心被炸，美以反应再次印证中国猜想

嘻嘻笑

2026-03-26 09:54:20

当医生看病遇到同行，网友：基本一句劝都听不到了！

当医生看病遇到同行，网友：基本一句劝都听不到了！

夜深爱杂谈

2026-03-25 21:05:25

台胞迎来好消息，统一后可自驾直达北京，郑丽文获大陆诚挚邀请

台胞迎来好消息，统一后可自驾直达北京，郑丽文获大陆诚挚邀请

肖兹探秘说

2026-03-25 19:08:23

麦克阿瑟回忆朝鲜战争：一开始我是日夜祈祷，希望中国能早日参战

麦克阿瑟回忆朝鲜战争：一开始我是日夜祈祷，希望中国能早日参战

我不是沃神

2026-03-23 09:25:03

一场战争掀开了一个政治乞丐

维美丽心甜

2025-11-12 07:20:03

岛国女老师不科学身材大赏：巨灯细腰 TOP10，美到极致

岛国女老师不科学身材大赏：巨灯细腰 TOP10，美到极致

碧波万览

2026-03-26 01:20:03

“香港演员几乎全军覆没! 无戏可拍”引发网友热议

“香港演员几乎全军覆没! 无戏可拍”引发网友热议

许三岁

2026-03-26 11:35:13

78岁连路都走不稳还开演唱会，全网骂声一片，她却扬言回馈粉丝

78岁连路都走不稳还开演唱会，全网骂声一片，她却扬言回馈粉丝

洲洲影视娱评

2026-01-28 12:23:18

追踪人工智能动态

12346文章数 176424关注度

往期回顾全部

科技要闻

Meta高管狂分百亿期权，700名员工却下岗

头条要闻

伊朗议长和外长暂被移出美以清除名单时限4到5天

头条要闻

伊朗议长和外长暂被移出美以清除名单时限4到5天

体育要闻

35岁替补门将，凭什么入选英格兰队？

娱乐要闻

张雪峰家人首发声不设追思会丧事从简

财经要闻

黄仁勋：芯片公司的时代已经结束了

汽车要闻

一汽奥迪A6L e-tron开启预售 CLTC最大续航815km

态度原创

+arrTaiduYuanC[i].tag+' | '+arrTaiduYuanC[i].title+'
\

时尚

旅游

艺术

教育

军事航空

2026年了，最好看的还是“这件针织”！

旅游要闻

明起全面实行线上实名预约购票！云台山景区发布公告

艺术要闻

哪一座桥不是风景？

教育要闻

2027届注意：暑期实习=秋招通行证，错过等一年

军事要闻

担心特朗普突然停战以总理下令48小时尽力摧毁伊设施

© 1997-2026 网易公司版权所有 About NetEase | 公司简介 | 联系方法 | 招聘信息 | 客户服务 | 隐私政策 | 不良信息举报 Complaint Center | 廉正举报 | 侵权投诉

无障碍浏览进入关怀版