网易首页 > 网易号 > 正文 申请入驻

DeepSeek们狂造芯片,英伟达终于不香了?

0
分享至



不是哥们,DeepSeek要自己搞芯片???

事情是这样,前段时间,路透社报道说浓眉大眼的DeepSeek已经悄摸做了一年的AI芯片了,正在接触芯片设计、晶圆代工和存储厂商。

但这消息出来没几天,OpenAI就把自己和博通搞的Jalapeño芯片集群端了出来。完事儿同样也在这段时间,Anthropic也说要开始组建自己的芯片团队了。。。


不是你们一个个的,一边疯狂买英伟达产能,一边又公开表示也要下场搞芯片。难道老黄卖给他们的GPU不香了吗?

经过一番研究我发现,还真是不香了。。。

而这一切都是因为:推理芯片。


这个所谓的推理芯片,其实也不是啥新词。很多年前谷歌第一代TPU就在研究推理了,前几年各种研究推理芯片的初创公司也不少,像什么Groq、Cerebras、SambaNova,这些可以说是各有绝活。

但是之所以大家现在感到陌生,原因也是显而易见:这个行业在前几年一直都是不温不火,属于大厂们鸟都不鸟的领域。

那么问题来了,前几年大厂对此不甚上心,今年偏说婉婉类卿,为啥突然间大伙都夏侯惇坐飞机,高看一眼了呢?


因为划不来啊。。。这事在当年还没谱。

众所周知,大模型是个发展很快的行业,今天爆火的模型、技术方向,可能过两个月就无人问津了。今年的OpenCLaw小龙虾现在在哪发财咱都不知道,更别说前两年的大模型厂商了。

毕竟那时候旗帜鲜明反对LLM的都大有人在(你小杨哥YannLecun)。。。大模型能走多远都不好说,所以模型厂商们更不可能专门为推理造芯片了。


毕竟英伟达的卡又不是不能用,训练起来也嘎嘎好使,花时间研究推理芯片那不是闲的嘛。唯一搞推理的谷歌TPU,最开始也不是为大模型准备的,因为那时候大模型都还没出生呢。

但事情的转机,发生在两年前的这个时候。

2024 年 8 月,Google DeepMind 团队发表了一篇里程碑式论文,他们发现只要延长思考时间,模型的正确率就会直接暴涨。

9月开始,OpenAI 的o 系列就开始让原子弹爆炸了;翻过年,DeepSeek-R1 等深度思考模型又给了世界一顿中国震撼。

然后从去年到今年,大家逐渐认识到,AI Agent、多 Agent 协作集群、几十万字的超长上下文分析,已经成了大模型落地工作的标配。深度推理和 Agent 这套技术路线,基本得到了整个行业的确认。

随着技术路线的确认和发展,压力最大的除了前端兄弟,还有 GPU。。。。


随便打开一个AI对话框,我们在这里输入文字,AI就会返回文字,这看起来非常自然丝滑。

但从AI的视角看,你告诉AI“扮演一个猫娘”,它需要先理解“这句话到底说了个啥?”这一步就被称为Prefill。而AI读懂以后,开始学猫娘说话输出给你的过程,叫Decode

在Prefill阶段,AI要把一整句话拆成一个个token,然后分别理解这些tokens的含义,这个过程和AI的训练阶段非常相似。

模型怎么才能判断这些token的含义呢,这就涉及到了矩阵

而纵观天下硬件,最适合算矩阵的算中之霸,就是GPU。


然鹅,对GPU来说,发送问题的Prefill阶段,和输出回答的Decode阶段,计算过程却完全不同。。。

在Prefill阶段,我们一次性提供了数据,GPU可以自己切分、所有核心一起并行计算,这就很舒服。

用下面图片中的简化公式感受一下:假设我们输入的token需要一个4096参数的矩阵,那么计算出来每从内存搬运 1 个字节的数据,GPU就可以用这笔数据,执行上千次运算。

但一进入Decode 阶段,形势就出了问题。

众所周知,现在的大模型都是自回归的,说白了就是要知道上一个词才能算出来下一个词。所以原本Prefill阶段4096行的输入矩阵,到了Decode阶段,会暴跌成只有1行。

经过同样的计算,每搬运 1 个字节的数据,GPU就只能算一次。。。


这下就坏菜了。。。

在芯片内部,两个数据相乘的能量消耗非常少。但要把一个数据从显存搬到GPU里,消耗的能量和时间往往是前者的几十倍甚至上百倍。

所以要把一颗芯片的算力拉满,理想的情况一定是,搬一次数据进核心,然后在本地反复算上几万次。最忌讳的就是搬一次算一次,下次要用再临时去搬。

所以在Decode阶段,一个 70B参数140GB 权重的大模型,每向用户输出一个 Token,芯片就必须把这 140GB 从 HBM 显存里完整读入一遍,再吐一个字又重读一遍。

哪怕用上 3 TB/s带宽的顶级显存,输出速度也只有每秒21个token。。。


换句话说,老子花这么多钱买显卡,结果芯片有 80% 的时间在发呆等数据传过来,这nm谁受得了。

更要命的是,除了推理时间变长,为了记住前面几十万字的思考过程,模型必须把所有历史 Token 的特征全部缓存在显存里,每多思考一步,显存里要搬运的数据量(KV Cache)也跟着爆炸。(这就是为啥显存和内存都纷纷涨价)

过去显存还算够用的时候,各大厂商还能靠纯软件手段来轻松绷住。

比如搞连续批处理,把几十个用户的请求攒起来摊薄搬运成本;还有梁圣的潜在多头注意力机制,压缩 KV Cache来减少GPU的搬运量。

但这些都治标不治本。。。GPU在本质上是通用芯片而不是推理芯片,它就不是给来Decode的啊!


实际上,谷歌在很多年前就发现了这个问题。他们当时想到的办法非常简单粗暴,既然通用GPU这么拉,那我为什么不专门造一颗只为推理的芯片?

于是,第一代 TPU就诞生了。它用来解决数据搬运问题的核心技术,叫作脉动阵列(Systolic Array)

把芯片内部比作一个工厂,HBM显存是厂外的中央仓库,SRAM是流水线旁的小筐,计算核心就是打螺丝工位。普通的 GPU 算矩阵,就像一个工人每拧一颗螺丝,就要回显存仓库里拿一个零件,拧完再送回仓库。

而谷歌的脉动阵列,就是把打螺丝的过程变成了流水线,而且是个二维的流水线。


他们把上万个乘法计算单元(PE)焊成一个方阵,矩阵的权重数据一旦进了流水线,就像接力棒一样在工位之间横向传递计算,算出来的结果再依次传到下一层计算。

由于数据在相邻的核心之间直接传递,数据每进一次核心,就会在里面连续传递、复用几十上百次,根本不需要退回外部显存,压根就不需要中途再去搬运数据。

所以TPU的这波杀招也成了谷歌能摆脱英伟达卡脖子,在Gemini2.5时代一秒就能脉动回来的关键之一。(当然现在Gemini又拉了)


以前技术路线没定,TPU这种专用方案在大模型上没显出太大优势,大家也就继续买GPU。

而当现在深度推理让推理负载暴增,TPU的思路开始真正香了起来,包括谷歌都开始把TPU专门分出来训练版和推理版。

于是各大模型厂在这段时间都纷纷觉醒:是时候砸钱做专用的推理芯片了。

当然,吃够了英伟达卡脖子窒息play的大模型厂们,这一次没人愿意再当被动的买家。。。

比起每年把几十上百亿美元ATM给老黄,你还得看人家脸色,有这钱养一个芯片团队开销简直就洒洒水。


不过真要自己做了,大家也没有只按谷歌的 TPU 的路线去抄。毕竟模型都是自家的,怎么也得自己调教开发才能找到最适合的硬件啊!

拿 Anthropic 来说,脉动阵列虽然快,但大量的杂活就不能脉动回来了。所以 Anthropic不仅搞脉动流水线,还选择跟AWS深度合作了Trainium(另一方面A社自己也宣布要自研),拿着 Claude 模型运行的真实工序数据,反向写进底层编译器。

而投奔了英伟达的Groq,他们的思路就是极端流水线派,认为普通芯片把显存的数据搬来搬去完全是浪费。所以直接把HBM 显存给砍了,然后把整颗芯片塞满SRAM,相当于所有货都放在流水线旁边的小筐,随用随取。

相比极端派,国内的阿里就正好反过来。如果底层架构写死,到时候大模型架构变了咋办?所以他们选择拼一刀,让大量灵活通用的标准加工岛,一起拼同一套缓存SRAM。


至于OpenAI嘛,如果说前面几家都还在生产线上下功夫,他们相当于把整个工业园区重建了一遍。OpenAI的Jalapeno推理集群跟博通合作,把芯片、HBM、本地缓存、芯片间网络一起设计,靠让特定用户的 KV Cache 记忆档案和特定的算力集群绑定来减少搬运。

于是这么看下来,模型厂和硬件厂之间就形成了一个类似汽车行业的格局,比方谷歌就像比亚迪,从TPU 到 Gemini 全栈自研;OpenAI + 博通就类似吉利,放出图纸和需求来让能力最强的制造商落地;

而Anthropic + 亚马逊 AWS就有点像鸿蒙智行。

当然英伟达、Groq就还是那个卖铲子的人。无论上层算法风向怎么变,买老黄这套东西永远是最稳妥的选择。


最后再说说DeepSeek。

由于咱们目前能查到的信息只有DeepSeek说要搞推理芯片,但具体怎么个搞法,目前还没有信息出来。

不过,2025年梁圣写过一篇文章,点名下一代AI硬件最需要解决的问题就包括低精度计算、内存容量、计算效率、芯片间互联和低延迟通信。再加上DeepSeek模型的特点,咱们也可以脑补一下。

设计上大概率也是根据模型适配来设计芯片,但因为DeepSeek本身对KV Cache压缩,以及MoE的相关技术,可能会有更大的内存容量但优化算力,或者专门对通信路由做优化,比如降低数据精度来进一步压缩,留出专用数据通路等等。

当然最终还是以DeepSeek自己的技术论文为准,咱就不多bb了。


讲到最后,其实大伙可能会发现,AI厂商其实在这一波过程中和英伟达的关系似乎出现了一些微♂妙的变化。

以前大家都是让AI模型适应芯片,拿到什么卡,就研究怎么切分模型、压缩KV Cache、调教通信,恨不能直接变成H200的形状。

但现在,不是所有环节都必须要GPU了。以后不再是GPU厂商制约AI厂商,而是AI厂商可以主动选择适合自己的软硬件,以及上下游配套。

这样一来,模型公司就不用看硬件厂商的脸色适配了,翻身把歌唱属于是。

那么可想而知,以后在这条时间线上很有可能发生如下画面:

模型公司终于可以对芯片团队说,我的模型很大,你忍一下。

撰文:纳西

编辑:江江 & 面线

美编:素描

图片、资料来源

OpenAI:Jalapeño’s first results show industry-leading speed and efficiency in AI inference

OpenAI:Trading Inference-Time Compute for Adversarial Robustness

Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures

introl:AI Inference vs Training Infrastructure: Why the Economics Diverge

Ironwood: The first Google TPU for the age of inference

Google research:In-Datacenter Performance Analysis of a Tensor Processing Unit

reuters:China's DeepSeek developing its own AI chip, sources say

Dwarkesh:TPU competition, why we should sell chips to China, & Nvidia’s supply chain moat

Groq Inference Tokenomics: Speed, But At What Cost?

DeepSeek、NVIDIA等,部分图源网络


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
景甜背后纹身图片被疯传,张继科直播一番话,被指保护了景甜!

景甜背后纹身图片被疯传,张继科直播一番话,被指保护了景甜!

背包旅行
2026-08-31 10:01:31
今夏转会窗口,穆帅曾尝试为皇马签下33岁前国米中场;弗洛伦萨仍在努力

今夏转会窗口,穆帅曾尝试为皇马签下33岁前国米中场;弗洛伦萨仍在努力

福酱的小时光
2026-09-02 05:45:40
在北京,大批外地人已经开始撤退了

在北京,大批外地人已经开始撤退了

经济学教授V
2026-08-31 19:14:09
乌兹别克斯坦这波“截胡”真够快!8月30日,乌方公开本国飞行员驾驶中国歼-10CE战机回国的画面,正式成为该机型第二个海外买家

乌兹别克斯坦这波“截胡”真够快!8月30日,乌方公开本国飞行员驾驶中国歼-10CE战机回国的画面,正式成为该机型第二个海外买家

扶苏聊历史
2026-09-01 16:17:17
雷克萨斯新车官宣:9月1日 ,正式发布

雷克萨斯新车官宣:9月1日 ,正式发布

科技堡垒
2026-09-01 10:59:17
苹果官网更新,全新 CEO 正式发布!

苹果官网更新,全新 CEO 正式发布!

花果科技
2026-09-01 20:43:28
百岁高僧对我说了五句话,从此我再也没为任何事失眠过

百岁高僧对我说了五句话,从此我再也没为任何事失眠过

阿天爱旅行
2026-09-01 00:55:13
婚礼现场气氛微妙!海莉当众手指贾斯汀,疑似发生争执

婚礼现场气氛微妙!海莉当众手指贾斯汀,疑似发生争执

墨薷桃桃
2026-09-01 11:02:37
养老金调整在即,今年养老调整工作,有两个万万没想到

养老金调整在即,今年养老调整工作,有两个万万没想到

一些小事
2026-09-01 19:57:46
正式下课?赵勇发声,担任女排主教练,他1年的薪水有多少?

正式下课?赵勇发声,担任女排主教练,他1年的薪水有多少?

只记花开v
2026-09-01 01:08:11
孙俪当年能够演甄嬛,其实捡了三个女人的“漏”,一开始导演想找蒋勤勤,可皇帝是陈建斌,两口子演这戏太尴尬,只好作罢

孙俪当年能够演甄嬛,其实捡了三个女人的“漏”,一开始导演想找蒋勤勤,可皇帝是陈建斌,两口子演这戏太尴尬,只好作罢

背包旅行
2026-09-01 18:21:17
马斯克:成为强者的第一步——杀死内心所有的恐惧。你只活70年,归宿都是寂灭,怕什么

马斯克:成为强者的第一步——杀死内心所有的恐惧。你只活70年,归宿都是寂灭,怕什么

杏花烟雨江南的碧园
2026-08-30 16:15:03
8胜0负!继土耳其男篮后,又一支球队提前拿到世界杯入场券

8胜0负!继土耳其男篮后,又一支球队提前拿到世界杯入场券

篮球大视野
2026-09-01 19:55:02
李维康追悼会:戏迷们痛哭,濮存昕落泪,丈夫耿其昌蹒跚送别

李维康追悼会:戏迷们痛哭,濮存昕落泪,丈夫耿其昌蹒跚送别

叶公子
2026-09-01 14:15:44
“德国正步入其迄今为止最危险的时刻之一”

“德国正步入其迄今为止最危险的时刻之一”

环球时报国际
2026-09-01 07:50:26
张一山《重案六组》被观众要求下架,理由出奇一致:毁了警察形象

张一山《重案六组》被观众要求下架,理由出奇一致:毁了警察形象

白面书誏
2026-09-01 13:46:48
A股:刚刚,商务部等三部门重磅发布!做好准备,周三面临新变盘

A股:刚刚,商务部等三部门重磅发布!做好准备,周三面临新变盘

虎哥闲聊
2026-09-02 00:00:08
孙宇晨想靠近谷爱凌无从下手:不是他不行,是她的圈子自带防火墙

孙宇晨想靠近谷爱凌无从下手:不是他不行,是她的圈子自带防火墙

小椰的奶奶
2026-09-02 01:08:15
是时候重视养老金巨大差距:民心是最大的政治,公平是最强的动力

是时候重视养老金巨大差距:民心是最大的政治,公平是最强的动力

花小猫的美食日常
2026-09-01 00:05:19
日本已直接出兵参战,与五万朝鲜军队正面交火,战况激烈。美国媒体彻底看傻了眼:一旦冲突继续升级,会不会真的引爆第三次世界大战?

日本已直接出兵参战,与五万朝鲜军队正面交火,战况激烈。美国媒体彻底看傻了眼:一旦冲突继续升级,会不会真的引爆第三次世界大战?

人生录
2026-08-29 00:05:14
2026-09-02 06:24:49
差评XPIN incentive-icons
差评XPIN
用知识和观点Debug the world!
11406文章数 489812关注度
往期回顾 全部

科技要闻

抖音突发推荐算法大面积错乱!

头条要闻

美国银行副总裁在纽约时代广场被刺身亡 年仅32岁

头条要闻

美国银行副总裁在纽约时代广场被刺身亡 年仅32岁

体育要闻

大爹杨瀚森,让中国男篮有了容错空间

娱乐要闻

孙宇晨破防,他无法接受孙割这个名字

财经要闻

"电梯亲热门"后 惠州首富给老婆转238亿

汽车要闻

山城试驾启源Q06 不光是智驾好用还有700km的续航

态度原创

时尚
家居
健康
艺术
房产

夏天别总穿黑色裤子,试试这几款高腰裙,显瘦优雅又提气质

家居要闻

2026建博会(广州) 公装联探展交流活动

睡时发生脑梗,抢救时间该怎么算?

艺术要闻

刘晓庆竟然还会画画?

房产要闻

1.72万/㎡!断供十余年,科学城核心区终于开仓了!

无障碍浏览 进入关怀版