#观点创作激励大赛#
6月5日,深圳河套学院联合哈尔滨工业大学、华为等团队,在昇腾910C国产AI算力集群上,完成了1.6万亿参数大模型DeepSeek-V4-Pro的全参数后训练。模型算力利用率超过30%,关键训练算子效率提升14%,各项指标均达到工业级运行标准。根据公开信息检索,这也是业界首个由第三方机构基于国产算力集群完成的DeepSeek-V4-Pro全参数后训练工程实践。
这些数字,普通人读起来可能没什么感觉。我得先解释一下这里面的弯弯绕绕。
大模型的训练分两步:预训练和后训练。预训练是让模型“识字读书”,灌进去海量文本,学会基本的语言规则。后训练更像是“雕琢”——通过让模型学习人类的反馈、反复试错和修正,把它从一个“会说话”的机器训练成一个“会思考、会拒绝、会讲人话”的助手。这是一个精细活,对芯片的调度能力和稳定性要求极高。
![]()
更麻烦的是DeepSeek-V4-Pro本身的架构。它采用的是混合专家模型,你可以把它想象成一个庞大的专家团:平时回答问题只激活少数几位专家,看起来挺省事的。但后训练的时候,“专家们”之间的沟通量是普通模型的几十倍。这就像你让一群专家同时开会讨论,本来每个人分工明确,现在所有人都得互相打断、频繁交换意见,沟通链条一下子炸了。
以前的国产算力主要做的是让大模型“能用”,也就是推理部署。好比给模型修了一条单行道,你输入一个问题,它输出一个答案。但“全参数后训练”是要让模型学会自我反思和调整,相当于在单行道的基础上加了一座复杂的立交桥和多条反馈回路,计算量和通信量瞬间翻了好几倍。
要把这件事做成,团队在国产算力集群上搞定了三个硬骨头。
第一个是“显存拼图”。万亿级大模型不可能只塞进一张计算卡里,团队设计了精密的分布式方案,把庞大的模型参数像拼图一样,精确地分配到一千张卡的每一张上。
第二个是“负载均衡”。混合专家模型最怕的就是有的专家忙得够呛、有的却在闲逛。团队专门优化了调度策略,确保每个专家分工合理,跨卡通信不再堵车。
第三个最实际——有人“守夜”。全参数后训练最怕跑着跑着系统突然崩溃。团队搭建了完整的监控体系,所有指标可视可控,确保长达1500多步的训练过程中,没有出现一次中断或报错。
这三件事做到,才算是真正从“能跑”走到了“能训稳训优”。
从更深一层来看,这次突破其实一举打破了三重天花板。
第一重是“训练能力”的天花板。以前国产芯片只能做做推理、微调,真正的大规模训练还得靠英伟达的高端产品。这次有人真的拿国产芯片训了一个世界顶级的万亿参数大模型,而且是全过程、全参数,这就不是“能不能做实验”的问题了,而是“能不能实际干活”的问题。
第二重是“市场生态”的天花板。摩根士丹利5月发布的报告预测,华为将在2026年占据中国本土AI加速器市场62%的份额。2025年中国市场的AI加速卡出货约400万块,国产芯片占比41%,其中华为出货量排名第二,拿下约20%的市场份额。英伟达CEO黄仁勋在公开访谈中承认,公司已基本将中国AI芯片市场让给华为。他还在另一次节目中警告:“如果DeepSeek率先在华为平台上发布,那对我们国家来说将是灾难性的。”
第三重是“技术路线”的天花板。华为单颗芯片的算力相比英伟达确实存在差距,但它走的是另一条路——集群规模化。昇腾384超节点把384颗芯片通过高速总线连在一起,形成一个巨大的计算单元。华为副董事长徐直军说过,超节点将成为AI基础设施建设的新常态。
网上关于这件事一个很普遍的观点是,如果以DeepSeek为代表的顶尖开源模型能够优先在华为昇腾上运行,这对英伟达的CUDA生态将是一个真正的打击。CUDA是英伟达做了二十年的软件生态,全球数百万AI开发者都在上面写代码,这才是它真正的护城河。一旦国产软硬件形成闭环,这种依赖就会被打破。知乎上有人说:这不是“能不能用英伟达”的问题,而是“要不要依赖英伟达”的问题。
也有冷静的声音在提醒,训练端目前仍然主要由英伟达主导,国产芯片在云端大模型训练的稳定性还需要更多验证。开发者生态的碎片化问题也依然存在——不同芯片厂商有不同的编程接口,缺乏CUDA那种统一的迁移能力。
快思慢想研究院院长、科技创新专家田丰指出,包括很多国际权威机构都预测,中国在AI芯片领域最有望在2026年迎来“DeepSeek时刻”。
所谓“DeepSeek时刻”,不只是芯片性能追上来了。它更本质的含义是,从模型到算力形成了一条闭环——DeepSeek作为世界顶级的开源模型,主动适配了华为昇腾,而不是像过去那样万事都围绕英伟达的CUDA转。这就好比一架飞机和一架引擎终于接上了,不再只是各自跑各自的。
360集团的周鸿祎在2026年初预测,AI芯片市场英伟达一家独大的单极格局将在今年被打破,形成“英伟达主导训练、多家厂商分食推理”的双轨格局。现在回过头看,这个预测正在被事实验证。
这件事证明了一条路可以走通:当你拿不到最先进的制程、拿不到顶尖的HBM内存,你不一定要死磕那一条赛道。华为选择了用系统设计来弥补单芯片的不足,用规模换性能,用算法适配来榨干每一分硬件的潜力。
这类技术突破并不总是靠最前沿的设备硬拼。很多时候,瓶颈在哪里,创新就会在哪里爆发。当先进制程被封锁的时候,封装技术顶上来了;当顶级算力买不到的时候,架构创新顶上来了。这不是弯道超车,这是一个被逼到绝路的人,在每一块能发力的地方都硬生生地撕开了一道口子。
当然,国产芯片要走的路还很长。英伟达的算力代差依然存在,CUDA生态的惯性巨大,先进制程的制约短期内不会消失。但这次突破起码说明了一个事实:在极限封锁下,这条路是被堵死了,还是真的能走通,已经有了一次实战检验的结果。
这大概才是这件事最触及普通人内心的意义——是说明在一个被强行切断供应链的世界里,出口可能不在你想的那个方向,但它确实存在。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.