DeepSeek开源面向华为昇腾的编程工具、计算库和通信库,宣布把已经在英伟达平台上验证过的模型研发与训练软件能力,系统性地扩展到昇腾,即所有组件与此前面向英伟达平台的开源组件“一一对应”。
在DeepSeek推进新一轮融资、筹划大规模采购昇腾芯片的背景下,这是关键的一步。资本可以买来设备,但只有软件、模型和硬件真正协同起来,设备才会成为持续提供推理和训练的基础设施。
先在英伟达上验证,再把能力带到昇腾
重点是TileLang,这条路线首先在英伟达成熟平台上得到验证,如今已承载DeepSeek V4系列模型训练中大部分算子的实现;目前,DeepSeek训练中使用的每一个TileLang算子,在昇腾上都有对应的高性能实现。性能数据已经显示出潜力。按照团队自测,FlashMLA在昇腾950上的稀疏注意力预填充内核最高达到410 TFLOPS,约为硬件峰值的95%。这是特定算子的结果。
这是一条稳健的工程路径,先在成熟硬件上验证编程方法和真实训练需求,再将相关能力带到另一种架构上。迁移过程中,模型团队已有可供对照的数值结果、算子行为和性能经验,不必同时重新证明模型算法与编程工具是否成立。
TileLang是一种面向高性能计算内核的领域专用语言及编译系统。“Tile”意为分块,开发者用接近Python的语法,描述矩阵块怎样计算、数据怎样移动,编译器承担部分存储规划、调度和同步工作。它把编程抽象提高了一层,但仍允许开发者表达硬件特有的优化。
这层抽象,是“优雅迁移”的关键,尽量保留上层计算表达、接口和研发流程,把必须因硬件而异的工作交给不同后端。昇腾版本封装Ascend C底层能力,面向昇腾原生执行;构建时可以关闭CUDA,无须安装CUDA工具包。它不是让昇腾模拟英伟达指令,而是开辟另一条执行路径。
“一一对应”,究竟是什么
本次对应的是DeepSeek自己的六类开源组件,而非CUDA生态中的所有功能。
![]()
这里既有组件定位的对应,也有接口的对齐,但不能把它理解为功能、数据类型和性能的完全等价。在已经覆盖的任务上,它们可以提供不依赖CUDA的实现;但不能自动运行任意CUDA程序,也没有替代CUDA整个开发与运行生态。
它们与华为软件栈也不是相互取代的关系。CANN提供昇腾基础计算环境,Ascend C等工具暴露底层硬件能力,DeepSeek则把模型的具体需求转化为高性能实现。例如,DeepGEMM-Ascend直接针对昇腾矩阵乘加原语优化;DeepEP-Ascend使用Ascend C并连接华为通信设施。因此,这批组件也并非全部用TileLang编写。
总之,华为提供通用底座,模型团队贡献真实工作负载与专用优化,双方再共同改善底层工具。
训练的信号,已经进入代码
这次发布不能主要被理解为推理适配,因为公开代码已经包含直接面向训练的内容。
TileLang的昇腾示例中,不只有注意力前向计算,还有生成查询、键和值梯度的反向计算,并提供正确性测试。DeepEP-Ascend也展示了专家通信的反向过程:前向时分发Token、汇总专家输出,反向时则传回相应梯度。这些都是训练所需要的能力。
优化还跨出了单卡。公告明确提到双方共同推进昇腾950的128卡超节点方案,通信库也公布了最高EP128规模的测试。它说明工作已经进入多设备协同。
不过,DeepSeek公告说的是“大部分算子”,不是“大部分算力”;算子数量不能直接换算成计算量或训练时间。“所有训练中使用的TileLang算子都有对应实现”,也不是说整个训练系统的全部功能都已完成迁移。
同样,128设备通信测试,不等于完整模型的128卡训练,更不等于跨多个超节点的长期预训练验证。当前公开通信性能还依赖非公开的概念验证版驱动固件及手工配置,推荐的公开商用版本计划于10月中旬提供,部分通信功能仍待完善。
因此,DeepSeek已经在系统性建设昇腾训练所需的核心软件能力,下一步需要看到的,是端到端收敛、训练吞吐、长期稳定性和故障恢复,而不只是若干算子接近自身硬件峰值。
融资与16万片950,在这条迁移路线上
资本与硬件扩张,让这次软件发布有了更具体的背景。据The Information,DeepSeek正推进第二轮融资,目标以5000亿元估值募集500亿元,争取10月底完成;公司将超过70%的算力用于训练。媒体也报道过,DeepSeek计划在内蒙古的数据中心部署至少16万片昇腾950DT,交付进度取决于华为产能,履约可能超过一年。
这凸显了DeepSeek发布这些组件的意义,此前的大规模硬件计划主要指向模型服务,现在公开的软件建设,则进一步覆盖训练所需的能力。
两条路线可以同时推进。新增昇腾资源若承接更多推理需求,就有机会缓解既有GPU的服务压力,为研发释放资源;训练软件逐步成熟后,DeepSeek又可以验证并扩大昇腾承担训练任务的范围。继续使用英伟达,与建设昇腾训练能力,目前并不矛盾。
走向持续的芯模协同
DeepSeek与华为的合作,已经是深度的芯模协同。TileLang昇腾后端的初版主要由DeepSeek团队开发,并获得华为协作支持;双方的优化延伸至编译器、计算内核、通信和固件。这意味着模型需求开始直接参与底层软件体系的建设。
英伟达与OpenAI的合作中,同样明确提出共同优化模型、基础设施软件与硬件软件路线图。
谷歌的TPU与Gemini,则具有更完整的纵向组织条件。谷歌发布第八代TPU时明确说明,芯片与DeepMind共同设计,将模型架构、应用需求、网络和软件纳入协同。它不仅让模型适应现有硬件,也让未来硬件按模型需求改变。
DeepSeek这条路线的独特价值,在于把跨企业合作的成果开放出来。其他团队可以研究、复用和改进真实模型所需的优化,减少重复移植,让更多国产设备不仅能跑模型,还能高效支持模型迭代。但其他芯片仍需建设自己的后端,开源不会自动消除硬件差异。
DeepSeek英伟达平台积累能力的基础之上,逐步获得对昇腾的选择,并且让自己的模型研发与训练能力,具备在更多硬件平台上延续的条件。
参考:
DeepSeek及文内相关github文档
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.