网易首页 > 网易号 > 正文 申请入驻

Jalapeño 跑分炸场,GPU 推理路线开始分裂?

0
分享至


Token 成本成为大模型硬件竞争的新坐标。

作者丨郑佳美

编辑丨岑 峰

今天,OpenAI 的自研推理芯片 Jalapeño,终于从规格表走到了跑分台。

这次公开的数据很接地气:Token 吞吐、生成延迟、单位功耗下能跑多少推理。因为大模型上线以后,芯片面对的早就不只是一次训练任务。ChatGPT 要一直回消息,Reasoning 模型要持续生成长链路内容,Agent 还会一轮接一轮调用模型。算力再高,Token 吐得慢、延迟压不下来、功耗又高,数据中心照样难受。

成绩一出来,Reddit 很快就把 Jalapeño 和 NVIDIA Rubin 摆到了一起。有人认为它已经进入 Rubin 的效率区间,也有人认为测试条件、软件优化和整个平台形态没有对齐,现在还没法直接分高下。争论暂时停在这里,没有统一答案。


更巧的是,Jalapeño 并不是孤例。NVIDIA 正在把 Groq 3 LPU 拉进推理系统,专门处理 Token 生成;Google 也把 TPU 8 拆成偏训练和偏推理的两条路线。几家公司几乎在同一时间开始重新拆芯片的工作,背后那套硬件逻辑难道真的已经变了吗?


01


Jalapeño 在看 Token 怎么跑

OpenAI 公布的数据里,Jalapeño 在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上,峰值吞吐位置每瓦完成的 AI 工作提高约1.5~1.9 倍,端到端延迟降低约1.7~3.6 倍;在交互速度要求较高的区间,性能提升达到约2.1~4.1 倍。芯片额定功耗是700W,这批负载中的持续功耗没有超过550W。雷峰网


这些数字为什么围绕 Token 展开,需要先看一次大模型推理内部发生了什么。

输入 Prompt 时,模型进入 Prefill。假设一次输入8KToken,这些 Token 可以大规模并行计算,模型权重从 HBM 取出来之后,会被很多 Token 重复使用。此时矩阵比较大,计算密度高,矩阵计算单元很容易忙起来。

开始生成答案后,模型进入 Decode。它需要一个 Token 接一个 Token 往外生成,新 Token 又依赖前面的状态。并行度下降了,模型权重却依然要读,Attention 还要不断访问此前保存下来的 KV Cache。

所以两段推理看起来使用相同的 Transformer,芯片看到的负载却差别很大:Prefill 更容易受到计算能力限制,Decode 更容易卡在内存带宽和数据移动上。OpenAI 在 Jalapeño 的架构说明里也明确把两者做了这一区分。雷峰网


用 Roofline 模型可以把这个问题看得更清楚。芯片能发挥多少性能,大致取决于两个上限:可达性能 ≈ min(峰值计算能力,内存带宽 × 算术强度)算术强度说的是,搬运一份数据以后,能拿它做多少计算。

训练和 Prefill 的矩阵足够大,一次读取权重能够服务大量 Token,所以算术强度很高。低 Batch Decode 里,情况会反过来。假设 Dense 模型有P个参数,每个参数平均占b Byte,生成一个 Token 涉及约2P FLOPs量级的矩阵运算,而读取一遍权重需要约P × b Byte,只考虑权重部分,算术强度粗略只有:2 / b FLOPs/Byte。

参数量P在这个比例里直接被约掉了。换句话说,模型从几百亿参数变成几千亿参数,Decode 依然要面对同一类问题:计算阵列可以做得很强,但 HBM 如果没有及时把权重送过来,新增计算单元就会等数据。


Jalapeño 因此没有只在矩阵乘上堆资源。OpenAI 强调的是让模型状态和 KV Cache 显式放在合适的位置,尽量保持数据局部性,再通过芯片内部的计算、内存和网络协同完成不同推理阶段。它还刻意维持一种相对均衡的架构,让同一种加速器既能处理 Prefill,也能处理 Decode,而不需要提前把机器固定分成两套资源池。

这也解释了 Reddit 上为什么很难靠一个数字结束 Jalapeño 和 Rubin 的争论。

一部分讨论引用 SemiAnalysis 的比较,认为 Jalapeño 在部分单位成本 Token 指标上已经进入 Rubin 的区间,而且 Jalapeño 这批结果没有依赖 speculative decoding。


另一部分讨论则认为,当前公开测试主要是相对规则的负载,Rubin 的软件优化方式不同,Jalapeño 还处在生产资格验证和规模部署之前,更复杂的 Agent 型长上下文负载也缺少足够公开数据。


还有人直接把 NVIDIA 的比较对象扩大到了 Rubin GPU 加 Groq 3 LPX,而不再只看 Rubin GPU。


现有讨论可以搬出来看,但还不足以给两套系统下一个简单排名。


02


最合适做推理芯片的时代

专用推理硬件其实早就存在,变化在于大模型的运行方式。

训练一轮模型虽然昂贵,但它毕竟是一段集中发生的计算过程。模型上线之后,ChatGPT、Claude、代码助手以及各种 Agent 会持续运行,每次聊天、代码生成、搜索和工具调用背后,服务器还在不断生成 Token。

推理因此从训练之后的配套工作,变成了长期占用电力、服务器和机房容量的负载。

Agent 又把这个问题放大了一次。普通聊天里,几十毫秒的差异可能只体现为文字快一点出现。Agent 的任务经常是串行的:模型先判断一步,调用工具,拿到结果后继续判断,再进入下一步。单次推理增加的延迟,会一路传到后面的步骤。


此时 GPU 有一个经典矛盾。想把 GPU 用得更满,可以增加 Batch。模型权重从 HBM 读一次,同时给几十个请求使用,权重复用率提高,矩阵也更大,总 Token 吞吐自然会上升。

但在线请求不能无限等着凑 Batch。Batch 越小,单用户响应越快,权重复用率却会下降;Batch 越大,整台机器的吞吐更漂亮,单用户的 Token 延迟又可能上升。

OpenAI、NVIDIA 和 Google 现在展示性能时越来越喜欢画Tokens/s/userTokens/s/watt之间的 Pareto 曲线,背后就是这组交换关系。


长上下文还增加了另一笔成本:KV Cache。

Transformer 在生成新 Token 时,会把此前 Attention 的 Key 和 Value 保存起来,避免每次重新计算全部历史。上下文越来越长,KV Cache 也跟着增长。Agent 又会不断积累系统 Prompt、工具返回、网页、代码和历史步骤,这些状态可能跟着一个 Session 存在很久。


于是调度器不能只看“哪颗芯片现在空闲”,还得考虑“这个请求的数据现在在哪”。如果 Prefill 在一组机器完成,Decode 被迁到另一组机器,KV Cache 也可能跟着跨网络移动。对于长上下文模型,这次搬运本身就会消耗带宽和时间。

到了这里,推理芯片的价值已经不只来自减少几次计算。它开始围绕一整条数据路径做优化:权重从哪里来、KV Cache 留在哪里、一次 Token 生成需要访问几次 HBM、数据需不需要跨芯片,以及计算单元有多少时间处在等待状态。

而 NVIDIA 选择的办法,比 Jalapeño 更激进一些——它直接把推理内部拆开了。


03


GPU 不再包下整段推理

Hot Chips 2026 上,NVIDIA 展示了 Groq 3 LPU 在 Vera Rubin 系统里的位置。

逻辑非常清楚:GPU 很适合 Prefill,大矩阵、高并行、较高的权重复用率正好发挥 GPU 的能力;到了低延迟 Decode,NVIDIA 开始让 Groq 3 LPU 接手大量工作。ServeTheHome 在现场报道中直接把 LPU 的作用概括为填补 Vera Rubin 在低延迟 Decode 区域的短板。


Groq 的芯片设计也几乎围绕这件事展开。一套 LPX 机架有256颗 LPU,加起来只有128 GB SRAM,容量和 GPU 机架里的 HBM 没法放在一个尺度上比较,但聚合 SRAM 带宽可以达到40 PB/s

这个设计看重的就是“近”。HBM 能装很多模型状态,却离计算单元更远;SRAM 很贵、容量难做大,但数据就在芯片内部,能够提供极高带宽和很低的访问延迟。


Decode 每一步做的计算有限,又频繁取数据,把数据放得更靠近 ALU,收益会非常直接地反映在下一个 Token 的等待时间上。

Groq 还进一步减少了动态硬件控制。LPU 是确定性执行架构,指令调度主要由软件提前完成。每颗芯片同时充当处理器和路由器,编译器会一起安排计算资源和网络资源,甚至省掉了传统硬件流控和虚拟通道这类机制。


代价也很明显:这种架构没有 GPU 那么通用,片上 SRAM 又装不下完整的大模型状态。所以 NVIDIA 没有让 Groq 3 独立运行整个模型,而是做了一套更复杂的异构系统。


Prefill 在 GPU 上进行,大部分 Decode 放到 LPU;Decode 里的 Attention 又可以回到 GPU。GPU 和 LPU 分别维护自己的 KV Cache,两边主要交换 draft Tokens,同时通过 micro-batch 把计算和通信重叠起来。由于 LPU 是同步域,而 GPU 和外部 KV Cache 属于异步系统,NVIDIA 甚至加入 FPGA 作为两边的异步桥接。

这套结构很能说明 AI 芯片分工已经走到了什么程度。它拆的已经不只是“训练芯片”和“推理芯片”,连一次 Decode 里面的不同部分也可以放到不同架构执行。

不过 NVIDIA 展示的数据也给出了这条路线的边界:当业务只追求总体吞吐,并且能够接受较高延迟时,Rubin GPU 依然很有效率;随着对单用户 Token 速度要求提高,LPX 才逐渐发挥优势,而使用更多 LPU 之后,总体吞吐效率也会下降。


所以 Groq 3 的出现并不意味着 GPU 被推理淘汰了。它说明另一件事:同一颗 GPU 很难同时占住高吞吐和极低延迟两端,让两种硬件分别跑自己更擅长的区间,系统反而更容易把性能曲线拉开。

Google 则把这道切口放在了更上层。



04


训练和推理,用两套芯片配方

Google 在 TPU 8 这一代同时做了 TPU 8t 和 TPU 8i,t面向训练,i面向推理。这种分法背后的逻辑,直接写在芯片的内存配置上。

Hot Chips 现场展示中,TPU 8t 使用6组 HBM,TPU 8i 反而用了8组。Google 给出的解释是,推理每单位计算需要更多 HBM,同时还需要更高比例的 SRAM,因此 8i 把更多资源给了 SRAM、内存容量和带宽。


这个差异很值得琢磨。如果 AI 芯片只是在比矩阵算力,推理版没有理由把这么多芯片面积和封装资源花在内存上。TPU 8i 这样设计,说明 Google 看到的瓶颈已经移到了数据供应。

训练时,大 Batch 能够把权重读取成本摊到很多 Token 上;Decode 中每次生成的 Token 很少,权重和 KV Cache 却仍然频繁访问。于是每单位 FLOPS 需要配多少 HBM 带宽,两类任务的答案并不一样。

Google 甚至把这种差异做到了网络拓扑。过去 TPU 常用的3D Torus更适合训练,强调的是大规模集群里的整体吞吐。TPU 8i 支持 BoardFly,网络路径更短:BoardFly 的路径上限为7 hops,3D Torus 则达到16 hops


对训练来说,几次额外网络跳转之后通常还有很大一块矩阵计算,通信时间可以被摊薄。Decode 每一步的计算窗口短,几跳网络延迟更容易直接落进 Token 间隔里。

MoE 又让这个问题变得更明显。MoE 可以让一个 Token 只激活一部分 Expert,从计算量上看很划算,但 Router 会把 Token 发往不同 Expert。一旦这些 Expert 分布在不同芯片上,计算减少的同时,All-to-All 通信会增加。


因此 TPU 8i 还加入了 Collective Acceleration Engine,把部分 collective 操作放在靠近网络接口的 I/O Die 上处理。数据无需先搬进 Compute Die,再经过 HBM 完成操作,可以直接省掉一部分芯片内部数据移动。

训练版 TPU 8t 的资源分配则明显朝另一边倾斜。训练需要大量 FLOPS,也需要巨大的 Scale-Up 域去同步参数和梯度。TPU 8t 的 Superpod 可以扩展到9600颗芯片,拥有约2 PB共享 HBM 和121 EFLOPS FP4聚合计算能力,Google 还为它引入 Virgo 网络,把更大范围的训练连接做成专门体系。


Google 在现场还提到了一个很实际的芯片设计问题:dark silicon。

芯片面积和功耗预算有限。如果同一颗芯片同时塞入训练需要的大量矩阵计算资源,又塞进推理需要的更多 SRAM、HBM 和低延迟网络,在某一种 workload 运行时,总会有一部分电路长期闲置。


既然两种任务已经需要不同的资源比例,直接做两颗芯片反而更干净。


05


从 FLOPS 到 Token 经济学

把三条路线放在一起,差异其实很清楚。

OpenAI 做 Jalapeño,把芯片专用化到 LLM 推理这一层,但保留 Prefill 和 Decode 在同构硬件上的灵活调度;NVIDIA 往下继续拆,让 GPU 和 Groq LPU 分担一次推理里的不同阶段;Google 往上切,把训练和推理直接做成两颗 TPU。

这几条路线背后并没有神秘的新计算原理,改变的是资源比例。训练希望把更多晶体管投入矩阵计算和大规模互联,因为高 Batch 能把数据搬运成本摊开;低延迟推理需要更高的 HBM 带宽、更大的 SRAM、更好的 KV Cache 局部性和更短的网络路径,因为很多时间花在等待数据上。

当两类负载需要的“芯片配方”越拉越开,用一颗通用芯片同时照顾它们,效率损失自然会越来越明显。

这也是为什么这轮硬件竞争里的核心数字正在变化。FLOPS 依然重要,但旁边开始出现Tokens/s/user、TBT、TTFT、Tokens/kW、HBM 带宽以及网络延迟。

它们描述的其实是同一件事:算力已经放在那里了,系统能不能持续把数据喂进去,并把生成的 Token 尽快送出来。

OpenAI、NVIDIA 和 Google 现在选择的分界线还不一样,后面真正会继续变化的,很可能也是这条线应该画在哪里。

训练和推理可以拆,Prefill 和 Decode 可以拆,Decode 内部的 Attention 与其他计算也可以继续拆。拆得越细,单项效率越容易提高,但资源调度、KV Cache 搬运和跨硬件通信也会变得更复杂。

因此下一阶段 AI 芯片竞争的难题,或许已经不只是造出一颗更强的芯片。

更难的是决定:哪些任务值得专门做一颗芯片,哪些任务继续放在同一套硬件里,整套系统的Token成本才更低。

参考链接:https://openai.com/index/jalapeno-first-results/

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
媒体:刘翔退役后代言费不再分成给体育局!终身合同每年仅几百万

媒体:刘翔退役后代言费不再分成给体育局!终身合同每年仅几百万

念洲
2026-08-28 13:16:58
51岁何炅生图曝光!脸部下垂全是褶断崖式衰老,现场互动好心酸

51岁何炅生图曝光!脸部下垂全是褶断崖式衰老,现场互动好心酸

八星人
2026-08-27 14:27:26
人民日报:在网上写“小作文”构陷他人,必付出代价

人民日报:在网上写“小作文”构陷他人,必付出代价

蓬勃新闻
2026-08-28 14:25:13
俄乌战争,正朝着我们原本不敢想象的方向发展

俄乌战争,正朝着我们原本不敢想象的方向发展

谢葥邮轮摄影
2026-08-26 18:06:01
美国专家:日本怎会傻到去挑衅中国这个大块头,实在匪夷所思。

美国专家:日本怎会傻到去挑衅中国这个大块头,实在匪夷所思。

迷彩人生
2026-08-28 11:50:02
人类也许不是唯一生命?231亿公里外的飞船传回照片,轰动了世界

人类也许不是唯一生命?231亿公里外的飞船传回照片,轰动了世界

抽象派大师
2026-08-29 18:27:02
超级大瓜,再吃一次,我还加过她……

超级大瓜,再吃一次,我还加过她……

揭幕者
2026-08-28 16:00:37
大雷美女打僵尸新游大更新!紧盯翘臀打的到怪吗

大雷美女打僵尸新游大更新!紧盯翘臀打的到怪吗

游民星空
2026-08-28 14:03:28
中国记协公号发文:新华社记者吉隆口岸做直播,救援人员大喊:“快撤!”

中国记协公号发文:新华社记者吉隆口岸做直播,救援人员大喊:“快撤!”

学申论的谈妹
2026-08-29 09:28:07
孙宇晨:区块链病人

孙宇晨:区块链病人

凤凰网财经
2026-08-28 19:07:51
韩国对中国白菜动手了,放话“采取必要措施”

韩国对中国白菜动手了,放话“采取必要措施”

开箱见山
2026-08-28 16:54:25
医生发现:经常跑步的糖尿病患者,用不了多久,身体会有4大改善

医生发现:经常跑步的糖尿病患者,用不了多久,身体会有4大改善

荆医生科普
2026-08-29 18:20:05
白魔被骑士裁员 身体天赋非常劲爆还不能在NBA立足 到底有何玄机

白魔被骑士裁员 身体天赋非常劲爆还不能在NBA立足 到底有何玄机

大话火箭队
2026-08-29 18:30:33
原来他们是孙宇晨父母,背景强大身份不一般,难怪儿子敢曝光景甜

原来他们是孙宇晨父母,背景强大身份不一般,难怪儿子敢曝光景甜

奇怪的鲨鱼们
2026-08-28 11:15:15
调整! CCTV5直播中国女排半决赛时间改变,吴梦洁庄宇珊率队冲冠

调整! CCTV5直播中国女排半决赛时间改变,吴梦洁庄宇珊率队冲冠

南海浪花
2026-08-29 11:13:42
美国决定向韩国出售1.25亿美元美军最先进战术导弹,朝鲜:恶意图谋和威胁时刻存在将强力回应美国敌对行为

美国决定向韩国出售1.25亿美元美军最先进战术导弹,朝鲜:恶意图谋和威胁时刻存在将强力回应美国敌对行为

每日经济新闻
2026-08-27 21:12:48
长期坚持一件事有多爽?网友:时间会偷偷回馈你

长期坚持一件事有多爽?网友:时间会偷偷回馈你

另子维爱读史
2026-08-27 21:42:04
教练机被炸也是俄军无法承受的损失!廉价炸弹变远程导弹,炸死一堆大鱼

教练机被炸也是俄军无法承受的损失!廉价炸弹变远程导弹,炸死一堆大鱼

鹰眼Defence
2026-08-29 17:57:52
倘若美国不再支持台独,转而推动两岸和平统一,中国可以承诺统一后按约定购入一定数量的美债——只要美国放弃台湾,美债随便买

倘若美国不再支持台独,转而推动两岸和平统一,中国可以承诺统一后按约定购入一定数量的美债——只要美国放弃台湾,美债随便买

人生录
2026-08-28 00:05:12
拔出萝卜带出泥!毁掉刘翔的真凶,贪污1200万只是皮毛

拔出萝卜带出泥!毁掉刘翔的真凶,贪污1200万只是皮毛

橙星文娱
2026-08-28 10:55:37
2026-08-29 18:59:00
雷峰网 incentive-icons
雷峰网
关注智能与未来!
70729文章数 656218关注度
往期回顾 全部

科技要闻

美团扭亏为盈后,外卖大战结束了吗?

头条要闻

男子从上海开三轮车赴拉萨 沿途摆摊卖炒饭5个月赚6万

头条要闻

男子从上海开三轮车赴拉萨 沿途摆摊卖炒饭5个月赚6万

体育要闻

米兰、巴黎、拉莫斯、巴克拉:所得与所失

娱乐要闻

孙宇晨最新发声:惊扰景女士非本意

财经要闻

刑自强:AI投资下半场中国蓄势待发

汽车要闻

东风日产NX8“喜柿橙意”限定色正式上市

态度原创

健康
房产
旅游
时尚
教育

脑出血两大夺命风险,早治早保命!

房产要闻

突发,三亚又大量卖地!

旅游要闻

贵阳入选暑期“赛事文娱+旅游”及全国热门避暑游目的地TOP10

Offer「毁约潮」,卷向应届毕业生

教育要闻

家长看的题目半天说,不是很容易做出来,真烦

无障碍浏览 进入关怀版