![]()
今年4月,黄仁勋在一次访谈里说了句重话:DeepSeek 在华为芯片上发布模型的那一天,对美国来说将是"可怕的结果"。
半年后的9月30日,这一天真的来了。DeepSeek 悄无声息地干了一件大事——把面向华为昇腾平台的全套底层基础设施开源了:算子编程语言编译工具、计算库、分布式通信库,一共5个组件,和之前面向英伟达的版本一一对应。
翻译成人话就是:以后用国产芯片训练和运行大模型,工具箱是现成的,代码是公开的,拿来就能用。
这件事没有发布会,没上热搜,但我认为它是今年国产 AI 最重要的一块拼图。黄仁勋怕的不是华为造出芯片,而是有一天,全世界发现不用他的芯片也能把事办成。
一、先搞清楚:为什么换个芯片,比换手机还难?
很多朋友不理解:芯片不都是算数的吗?英伟达的换成华为的,把代码搬过去不就行了?
没这么简单。
你想想,你用了十年微信,通讯录、聊天记录、支付绑定全在上面。现在让你换一个聊天软件,就算它功能一模一样,你敢换吗?你舍不得的不是那个 App,是沉淀在里面的所有东西。
芯片行业也是这样。英伟达真正的护城河从来不是 GPU 硬件,而是一个叫 CUDA 的软件生态——过去近二十年,全世界几百万程序员都在用 CUDA 写 AI 代码,所有的框架、算子、教程、踩坑经验,全长在 CUDA 这棵树上。
所以企业换芯片的真实成本是:把跑在 CUDA 上的全部代码推倒重写一遍。一个几百人的算法团队,可能折腾一年,性能还未必追得上。这就是为什么明明英伟达的卡又贵又买不到,大家还是捏着鼻子用——锁住你的从来不是产品,是迁移成本。
这道墙有多贵?举个行业里的普遍情况:一家中型 AI 公司想把模型从英伟达平台迁到国产芯片,光是底层算子重写和性能调优,就要搭进去一个核心团队大半年的时间,期间业务迭代基本停摆。很多企业不是不想换,是真换不起。
而 DeepSeek 这次开源的 TileLang 昇腾版,就是来拆这道墙的。
二、这一枪,打在了七寸上
TileLang 是什么?你可以把它理解成芯片界的"万能翻译官"。
以前写底层算子(就是 AI 计算里最基础的那些运算模块),得用 CUDA 一种语言写死,换个芯片就全废了。TileLang 的做法是:算子用一种通用语言描述,然后自动编译到不同硬件上。写一次,英伟达能跑,昇腾也能跑。
更关键的是,这不是实验室里的 PPT。TileLang 已经实际承载了 DeepSeek V4 系列训练的大部分算子——人家是拿真刀真枪的千亿参数大模型验证过的。
这一开源,事情的性质就变了:
第一,迁移成本换了买单人。 以前是每家企业自己重写代码,现在变成芯片厂商适配一次、全行业共享。一家开源,千家受益。
第二,"当天支持"成了常态。 回想2025年初,DeepSeek 模型上线昇腾还是"追随者模式"——先在英伟达平台开发好,华为工程师再吭哧吭哧移植。到了今年4月 V4 发布,昇腾做到了 Day0 首日支持,发布当天全套部署代码、优化指南直接公开。美国半导体研究机构 SemiAnalysis 做了独立评估,结论很扎心:V4 发布首日,全球只有两套软件栈能完整支持它——英伟达的 CUDA,和华为的 CANN。
第三,性能是真能打。 昇腾950上的稀疏注意力算子,读取阶段跑出了 410 TFlops,达到硬件理论极限的95%;生成阶段 360 TFlops,也有83%。什么概念?硬件潜力几乎被榨干了,这不是"能用",这是"好用"。
还有一点更能说明问题的深度:V4 这个模型,从架构设计阶段就考虑了昇腾的特性。100万 Token 超长上下文下,推理计算量只有上一代的27%,显存里的键值缓存只有10%;专家权重用4位浮点存储,而昇腾950恰好新增了对这种格式的硬件支持,英伟达上一代 Hopper 反而不支持。SemiAnalysis 的评价很直接:V4 架构"部分是为昇腾推理协同设计的"。这已经不是"把模型搬到国产芯片上",而是"照着国产芯片的特点设计模型"——芯模协同,双向奔赴。
顺便说个细节,特别有意思。昇腾950在华为内部的代号叫"大卫"——就是《圣经》里那个用弹弓干掉巨人歌利亚的牧羊少年。华为把心思全写在代号里了:我就是那个冲着歌利亚去的。
巨人不可怕,可怕的是巨人开始回头张望。
三、别急着嗨,两个短板还在明面上
写到这儿必须泼两盆冷水,不然就成爽文了。
第一盆:训练端还没完全跑通。 推理(就是让模型跑起来回答问题)的国产化已经验证了,但用最先进的国产芯片从零训练一个前沿大模型,证据依然模糊。DeepSeek 自己吃过亏:2025年尝试用昇腾训练 R2 模型,华为工程师驻场协助,折腾数月没能完成一次成功训练,最后只能换回英伟达 H20。V4 从预期的2月拖到4月底才发布,业内普遍认为就跟这次迁移受挫有关。
第二盆:产能卡着脖子。 华为计划2026年交付约75万颗昇腾950,听着不少?折算下来相当于美国一周的 AI 芯片产量。彭博社报道,DeepSeek 在内蒙古的新数据中心计划部署至少16万颗昇腾950,但部署进度完全取决于华为能造出多少。DeepSeek 也坦承 V4-Pro 目前服务吞吐量"十分有限",得等昇腾950超节点批量上市,价格才能打下来。
软件生态这道墙拆了,但硬件供给这道墙还在砌。好消息是,华为已经把昇腾960的发布时间提前了三个季度,一年一代的节奏稳住了;汪涛在全联接大会上确认,昇腾950超节点已进入规模商用,上一代910C超节点部署超过1000套。
资本也在往这个方向押注。《金融时报》今年5月报道,国家集成电路产业投资基金(大基金)正在洽谈领投 DeepSeek 成立以来的首轮外部融资,估值约450亿美元,腾讯也参与了谈判。如果成真,模型公司和国产芯片产业链就算彻底绑在了一条船上。
还有个更耐人寻味的动向:路透社7月爆料,DeepSeek 自己也在研发推理芯片,目的是同时降低对英伟达和华为两家的依赖。OpenAI 联手博通造芯、Anthropic 评估自研,全球模型巨头都在走这条路。这说明什么?说明顶级玩家心里都清楚:生态可以共建,命脉必须自持。
四、三个趋势,提前看懂
趋势一:国产算力芯片进入放量元年。 中信证券预计2026年国产算力芯片出货量至少翻倍。昇腾在中国市场的份额已经从2022年的3%涨到如今的50%,同期英伟达从95%跌到8%——四年攻守易形,这个曲线比任何口号都有说服力。
趋势二:汽车和机器人,是国产算力最大的接盘方。 别以为这事离车圈很远。华为乾崑智驾的模型训练、各家车企的城市 NOA 大模型、人形机器人的具身智能,全都要吃算力,而且吃的都是国产算力。国庆期间110.7万用户用乾崑智驾出行,背后跑的就是这套体系;中国机器人上半年出货占全球97%,训练这些"机器人大脑"的芯片,正在批量换成国产。芯片、模型、汽车、机器人,正在拧成一条国产链条。华为徐直军在全联接大会上也把话挑明了:推动芯片与半导体价值链全面自给,是"必然的前进道路"——哪怕芯片不是最先进的,至少不必日复一日担心断供。对于车企这种一旦停产损失以亿计的行业来说,"供应有保障"四个字,比跑分重要得多。
趋势三:"美国卡脖子,中国出标准"的反转剧本。 CUDA 封闭了快二十年,而 DeepSeek 选择把整套工具链开源。开源意味着什么?意味着全世界的开发者都能来用、来改、来贡献。当年的安卓就是这么掀翻诺基亚的。英伟达用封闭生态锁住世界,中国团队正用开源生态反向解锁。这套打法,我们在手机操作系统上已经见过一次了。当年没人看好安卓,如今它占了全球智能手机的七成江山。
五、普通人该看点什么?
如果你是企业主或开发者:现在评估国产算力方案的时机成熟了。迁移成本从"重写全部代码"降到"换个编译目标",这笔账值得重算一遍。
如果你是投资者:盯住三个信号——昇腾950的实际出货节奏、DeepSeek V4-Pro 的价格下调时点、以及昇腾960能否如期在2027年一季度发布。产能兑现的那天,才是行情真正的主升浪。
如果你只是个围观群众:记住一个朴素的道理——十年前我们说"缺芯少魂",芯片是芯,操作系统是魂。今天,芯有了"大卫",魂有了开源工具链。这条路走了六年,从被封锁到被模仿,不容易,但走通了。
结语
黄仁勋当年那句"可怕的结果",如今听来更像一句预言。
但他可能没想到,这一天不是以"替代英伟达"的方式到来,而是以"给全世界多一个选择"的方式到来。DeepSeek 开源的不只是5个组件,是一种可能性:AI 的底层标准,不必只由一家公司、一个国家书写。
封锁造就垄断,开源造就生态。历史会记住,2026年的这个秋天,中国 AI 把选择权还给了世界。
数据来源
红星新闻、封面新闻、财联社、DeepTech深科技、SemiAnalysis、路透社、彭博社、《金融时报》、中信证券研报、华为全联接大会公开信息
互动话题
你觉得国产 AI 芯片这一仗,最终靠什么赢?
A. 硬件性能追平英伟达
B. 开源生态聚拢全球开发者
C. 汽车、机器人这些自家应用场景喂出来
D. 以上都要,缺一不可
评论区聊聊你的判断。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.