网易首页 > 网易号 > 正文 申请入驻

OpenAI自研芯片Jalapeño跑分曝光:每瓦AI吞吐提升最高1.9倍,GPU推理路线开始分裂?

0
分享至

Token成本成为大模型硬件竞争的新坐标

OpenAI自研推理芯片Jalapeño今天终于从规格表走到了跑分台。这次公开的数据很接地气:Token吞吐、生成延迟、单位功耗下能跑多少推理。因为大模型上线以后,芯片面对的早就不只是一次训练任务。ChatGPT要一直回消息,Reasoning模型要持续生成长链路内容,Agent还会一轮接一轮调用模型。算力再高,Token吐得慢、延迟压不下来、功耗又高,数据中心照样难受。


成绩一出来,Reddit很快就把Jalapeño和NVIDIA Rubin摆到了一起。有人认为它已经进入Rubin的效率区间,也有人认为测试条件、软件优化和整个平台形态没有对齐,现在还没法直接分高下。争论暂时停在这里,没有统一答案。

更巧的是,Jalapeño并不是孤例。NVIDIA正在把Groq 3 LPU拉进推理系统,专门处理Token生成;Google也把TPU 8拆成偏训练和偏推理的两条路线。几家公司几乎在同一时间开始重新拆芯片的工作,背后那套硬件逻辑难道真的已经变了吗?

Jalapeño跑分数据:峰值吞吐位置每瓦AI工作提升约1.5~1.9倍

OpenAI公布的数据里,Jalapeño在GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T上,峰值吞吐位置每瓦完成的AI工作提高约1.5~1.9倍,端到端延迟降低约1.7~3.6倍;在交互速度要求较高的区间,性能提升达到约2.1~4.1倍。芯片额定功耗是700W,这批负载中的持续功耗没有超过550W。

这些数字为什么围绕Token展开,需要先看一次大模型推理内部发生了什么。输入Prompt时,模型进入Prefill。假设一次输入8K Token,这些Token可以大规模并行计算,模型权重从HBM取出来之后,会被很多Token重复使用。此时矩阵比较大,计算密度高,矩阵计算单元很容易忙起来。

开始生成答案后,模型进入Decode。它需要一个Token接一个Token往外生成,新Token又依赖前面的状态。并行度下降了,模型权重却依然要读,Attention还要不断访问此前保存下来的KV Cache。所以两段推理看起来使用相同的Transformer,芯片看到的负载却差别很大:Prefill更容易受到计算能力限制,Decode更容易卡在内存带宽和数据移动上。OpenAI在Jalapeño的架构说明里也明确把两者做了这一区分。

Roofline模型解释:Decode阶段算术强度只有2/b FLOPs/Byte

用Roofline模型可以把这个问题看得更清楚。芯片能发挥多少性能,大致取决于两个上限:可达性能约等于峰值计算能力与内存带宽乘以算术强度之间的较小值。算术强度说的是,搬运一份数据以后,能拿它做多少计算。

训练和Prefill的矩阵足够大,一次读取权重能够服务大量Token,所以算术强度很高。低Batch Decode里,情况会反过来。假设Dense模型有P个参数,每个参数平均占b Byte,生成一个Token涉及约2P FLOPs量级的矩阵运算,而读取一遍权重需要约P乘以b Byte,只考虑权重部分,算术强度粗略只有:2除以b FLOPs/Byte。

参数量P在这个比例里直接被约掉了。换句话说,模型从几百亿参数变成几千亿参数,Decode依然要面对同一类问题:计算阵列可以做得很强,但HBM如果没有及时把权重送过来,新增计算单元就会等数据。

Jalapeño因此没有只在矩阵乘上堆资源。OpenAI强调的是让模型状态和KV Cache显式放在合适的位置,尽量保持数据局部性,再通过芯片内部的计算、内存和网络协同完成不同推理阶段。它还刻意维持一种相对均衡的架构,让同一种加速器既能处理Prefill,也能处理Decode,而不需要提前把机器固定分成两套资源池。

Reddit争论:Jalapeño是否已进入Rubin效率区间?

这也解释了Reddit上为什么很难靠一个数字结束Jalapeño和Rubin的争论。一部分讨论引用SemiAnalysis的比较,认为Jalapeño在部分单位成本Token指标上已经进入Rubin的区间,而且Jalapeño这批结果没有依赖speculative decoding。

另一部分讨论则认为,当前公开测试主要是相对规则的负载,Rubin的软件优化方式不同,Jalapeño还处在生产资格验证和规模部署之前,更复杂的Agent型长上下文负载也缺少足够公开数据。还有人直接把NVIDIA的比较对象扩大到了Rubin GPU加Groq 3 LPX,而不再只看Rubin GPU。现有讨论可以搬出来看,但还不足以给两套系统下一个简单排名。

推理从配套工作变成长期占用电力和机房产能的负载

专用推理硬件其实早就存在,变化在于大模型的运行方式。训练一轮模型虽然昂贵,但它毕竟是一段集中发生的计算过程。模型上线之后,ChatGPT、Claude、代码助手以及各种Agent会持续运行,每次聊天、代码生成、搜索和工具调用背后,服务器还在不断生成Token。推理因此从训练之后的配套工作,变成了长期占用电力、服务器和机房容量的负载。

Agent又把这个问题放大了一次。普通聊天里,几十毫秒的差异可能只体现为文字快一点出现。Agent的任务经常是串行的:模型先判断一步,调用工具,拿到结果后继续判断,再进入下一步。单次推理增加的延迟,会一路传到后面的步骤。

此时GPU有一个经典矛盾。想把GPU用得更满,可以增加Batch。模型权重从HBM读一次,同时给几十个请求使用,权重复用率提高,矩阵也更大,总Token吞吐自然会上升。但在线请求不能无限等着凑Batch。Batch越小,单用户响应越快,权重复用率却会下降;Batch越大,整台机器的吞吐更漂亮,单用户的Token延迟又可能上升。

OpenAI、NVIDIA和Google现在展示性能时越来越喜欢画Tokens/s/user与Tokens/s/watt之间的Pareto曲线,背后就是这组交换关系。

长上下文与KV Cache:调度器不能只看哪颗芯片空闲

长上下文还增加了另一笔成本:KV Cache。Transformer在生成新Token时,会把此前Attention的Key和Value保存起来,避免每次重新计算全部历史。上下文越来越长,KV Cache也跟着增长。Agent又会不断积累系统Prompt、工具返回、网页、代码和历史步骤,这些状态可能跟着一个Session存在很久。

于是调度器不能只看“哪颗芯片现在空闲”,还得考虑“这个请求的数据现在在哪”。如果Prefill在一组机器完成,Decode被迁到另一组机器,KV Cache也可能跟着跨网络移动。对于长上下文模型,这次搬运本身就会消耗带宽和时间。

到了这里,推理芯片的价值已经不只来自减少几次计算。它开始围绕一整条数据路径做优化:

  • Prefill阶段计算密度高,矩阵计算单元容易忙起来,更容易受到计算能力限制;
  • Decode阶段并行度下降,模型权重依然要读,Attention还要不断访问KV Cache,更容易卡在内存带宽和数据移动上;
  • Agent串行调用会放大单次推理延迟,几十毫秒的差异会一路传到后面的步骤;
  • 长上下文让KV Cache持续增长,调度器必须考虑请求数据所在位置,跨网络搬运本身就会消耗带宽和时间。

Jalapeño这次公开的数据,把Token吞吐、生成延迟和单位功耗下的推理能力摆到了台面上。Reddit上的争论暂时没有统一答案,但NVIDIA把Groq 3 LPU拉进推理系统、Google把TPU 8拆成偏训练和偏推理两条路线,几家公司几乎在同一时间重新拆芯片的工作,已经说明Token成本正在成为大模型硬件竞争的新坐标。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
媒体:刘翔退役后代言费不再分成给体育局!终身合同每年仅几百万

媒体:刘翔退役后代言费不再分成给体育局!终身合同每年仅几百万

念洲
2026-08-28 13:16:58
51岁何炅生图曝光!脸部下垂全是褶断崖式衰老,现场互动好心酸

51岁何炅生图曝光!脸部下垂全是褶断崖式衰老,现场互动好心酸

八星人
2026-08-27 14:27:26
人民日报:在网上写“小作文”构陷他人,必付出代价

人民日报:在网上写“小作文”构陷他人,必付出代价

蓬勃新闻
2026-08-28 14:25:13
俄乌战争,正朝着我们原本不敢想象的方向发展

俄乌战争,正朝着我们原本不敢想象的方向发展

谢葥邮轮摄影
2026-08-26 18:06:01
美国专家:日本怎会傻到去挑衅中国这个大块头,实在匪夷所思。

美国专家:日本怎会傻到去挑衅中国这个大块头,实在匪夷所思。

迷彩人生
2026-08-28 11:50:02
人类也许不是唯一生命?231亿公里外的飞船传回照片,轰动了世界

人类也许不是唯一生命?231亿公里外的飞船传回照片,轰动了世界

抽象派大师
2026-08-29 18:27:02
超级大瓜,再吃一次,我还加过她……

超级大瓜,再吃一次,我还加过她……

揭幕者
2026-08-28 16:00:37
大雷美女打僵尸新游大更新!紧盯翘臀打的到怪吗

大雷美女打僵尸新游大更新!紧盯翘臀打的到怪吗

游民星空
2026-08-28 14:03:28
中国记协公号发文:新华社记者吉隆口岸做直播,救援人员大喊:“快撤!”

中国记协公号发文:新华社记者吉隆口岸做直播,救援人员大喊:“快撤!”

学申论的谈妹
2026-08-29 09:28:07
孙宇晨:区块链病人

孙宇晨:区块链病人

凤凰网财经
2026-08-28 19:07:51
韩国对中国白菜动手了,放话“采取必要措施”

韩国对中国白菜动手了,放话“采取必要措施”

开箱见山
2026-08-28 16:54:25
医生发现:经常跑步的糖尿病患者,用不了多久,身体会有4大改善

医生发现:经常跑步的糖尿病患者,用不了多久,身体会有4大改善

荆医生科普
2026-08-29 18:20:05
白魔被骑士裁员 身体天赋非常劲爆还不能在NBA立足 到底有何玄机

白魔被骑士裁员 身体天赋非常劲爆还不能在NBA立足 到底有何玄机

大话火箭队
2026-08-29 18:30:33
原来他们是孙宇晨父母,背景强大身份不一般,难怪儿子敢曝光景甜

原来他们是孙宇晨父母,背景强大身份不一般,难怪儿子敢曝光景甜

奇怪的鲨鱼们
2026-08-28 11:15:15
调整! CCTV5直播中国女排半决赛时间改变,吴梦洁庄宇珊率队冲冠

调整! CCTV5直播中国女排半决赛时间改变,吴梦洁庄宇珊率队冲冠

南海浪花
2026-08-29 11:13:42
美国决定向韩国出售1.25亿美元美军最先进战术导弹,朝鲜:恶意图谋和威胁时刻存在将强力回应美国敌对行为

美国决定向韩国出售1.25亿美元美军最先进战术导弹,朝鲜:恶意图谋和威胁时刻存在将强力回应美国敌对行为

每日经济新闻
2026-08-27 21:12:48
长期坚持一件事有多爽?网友:时间会偷偷回馈你

长期坚持一件事有多爽?网友:时间会偷偷回馈你

另子维爱读史
2026-08-27 21:42:04
教练机被炸也是俄军无法承受的损失!廉价炸弹变远程导弹,炸死一堆大鱼

教练机被炸也是俄军无法承受的损失!廉价炸弹变远程导弹,炸死一堆大鱼

鹰眼Defence
2026-08-29 17:57:52
倘若美国不再支持台独,转而推动两岸和平统一,中国可以承诺统一后按约定购入一定数量的美债——只要美国放弃台湾,美债随便买

倘若美国不再支持台独,转而推动两岸和平统一,中国可以承诺统一后按约定购入一定数量的美债——只要美国放弃台湾,美债随便买

人生录
2026-08-28 00:05:12
拔出萝卜带出泥!毁掉刘翔的真凶,贪污1200万只是皮毛

拔出萝卜带出泥!毁掉刘翔的真凶,贪污1200万只是皮毛

橙星文娱
2026-08-28 10:55:37
2026-08-29 18:59:00
固件更新中
固件更新中
有态度网友ytd
231文章数 70关注度
往期回顾 全部

科技要闻

美团扭亏为盈后,外卖大战结束了吗?

头条要闻

男子从上海开三轮车赴拉萨 沿途摆摊卖炒饭5个月赚6万

头条要闻

男子从上海开三轮车赴拉萨 沿途摆摊卖炒饭5个月赚6万

体育要闻

米兰、巴黎、拉莫斯、巴克拉:所得与所失

娱乐要闻

孙宇晨最新发声:惊扰景女士非本意

财经要闻

刑自强:AI投资下半场中国蓄势待发

汽车要闻

东风日产NX8“喜柿橙意”限定色正式上市

态度原创

本地
艺术
时尚
旅游
公开课

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

艺术要闻

乾隆献给太后的《金刚经》,由张廷玉之子抄写,这字美得难以言表!

Offer「毁约潮」,卷向应届毕业生

旅游要闻

贵阳入选暑期“赛事文娱+旅游”及全国热门避暑游目的地TOP10

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版