国庆前一天,DeepSeek没有发新模型。
它开源了一套面向华为昇腾平台的基础设施组件。TileLang、DeepGEMM、DeepEP、FlashMLA,一共六个。
所有组件,与此前面向英伟达平台的,一一对应。
这句话的分量,比“又发了一个开源模型”重得多。
什么意思?
DeepSeek训练V4系列模型,用的就是TileLang写的算子。现在它把这些算子在昇腾上重新实现了一遍。训练中用的每一个TileLang算子,昇腾上都有对应的高性能实现。
不是演示,不是“理论上可以跑”。是自己真在用的东西,整套搬过去了。
TileLang是什么?北大团队主导开发的一种编程语言,专门用来写高性能算子。说人话就是:以前给芯片写高效代码,得学厂商那套复杂的底层语言。现在写高层描述,编译器帮你压榨硬件性能。
效果有多夸张?有开发者说,不到100行代码,就能写出比Flash Attention 2原版快30%的实现。北大团队之前展示过,FlashAttention算子开发,代码量从500多行压到80行,性能持平。
英伟达的CUDA为什么难被替代?不是因为芯片快,是因为所有人都得用它的语言写代码。你换芯片,代码全废。
TileLang的逻辑是:你写一遍,换后端就能跑。英伟达能跑,昇腾也能跑。
DeepSeek官方原话:“建立新一代自主可控的GPU软件生态,首要的事情是先建立一个通用的、编程简单的、同时能达到硬件性能上限的高级语言。”
这次开源的六个组件,覆盖了矩阵运算、跨设备通信、稀疏注意力、向量计算、数据筛选。基本把模型训练和推理的核心环节包圆了。
而且DeepSeek还透露了一件事:正在和华为联合推进基于昇腾950的128卡超节点方案。
128卡超节点,是当前AI算力集群竞争的最前线。英伟达有NVLink,华为有超节点。DeepSeek直接参与进去做计算和通信的深度优化。
周鸿祎之前评价DeepSeek开源时说了一句话:“开源变根技术。一旦开发者都在你的生态里,你就成了根。”
TileLang昇腾版这次落地,就是这句话的实锤。国产AI算力生态第一次在核心算子编程工具层面,做到了与英伟达生态的能力对标。
不是芯片追上了,是软件生态开始追上了。
芯片再快,没人会写代码,就是一块砖。现在有人把“怎么写代码”这件事,从英伟达的独家语言,变成了可移植的通用语言。
这一步,比发十个模型都狠。
这一步,比发十个模型都狠。国产算力生态,这次能成吗?
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.