网易首页 > 网易号 > 正文 申请入驻

Holy shit!OpenAI自研推理芯片真的要掀桌子?

0
分享至


我们好久没有写SemiAnalysis的newsletter的文章解读了,主要原因是最近几篇文章,我感觉意思不大。但今天这篇,关于OpenAI的自研芯片,确实值得好好看一看,文章标题也起的比较夸张,但真的是很多地方超出了我的预期。

OpenAI自研芯片这事,我们一直在跟踪,从他们开始流片、回片,到有新闻说他们9个月设计出了这个芯片,我都觉得还算是正常节奏,说句站着不腰疼的话:这个芯片无非就是买买接口IP,在现在AI coding能力这么强的背景下,大幅缩短芯片设计和验证周期,都合理。

先说几个SA的观点,后面再详细解释。

1、它是通用推理芯片,不是 OpenAI 私有专用芯片。它可以跑 DeepSeek R1、Kimi‑K2.5、GPT‑OSS 等第三方开源模型,甚至用 Codex 简单提示词就能移植 Doom 游戏。并不是锁死 OpenAI 自家模型;只是它不做训练,只做推理

2、现在行业共识基本都是推理做Prefill‑Decode 解耦。prefill是计算密集,decode是带宽密集;把硬件拆成两组独立池子,分别优化,才能拉高 GPU 利用率;英伟达 Dynamo、大量云厂商都往这个方向走,解耦似乎是未来推理架构标准答案。但Jalapeño 选择完全同质、可流动的算力池,拒绝固定 PDD 硬件拆分。

3、软件的协同,也是超出预期。大家都知道我们的国产AI芯片,其实很大的问题都是在软件上。

4、CUDA的护城河“可能正在失效”。

5、SA认为把Jalapeño与Blackwell比较,并不公平,而应该对标Rubin。

6、Jalapeño预计从2027年开始逐步放量,大部分产出安排在2027年年底。

SA文章中也讲了关于这个芯片的互联(哪里用铜,哪里用光,周四直播的时候我们可以讲一下),以及对业内其他友商的影响,比如NV、AMD等。

这颗名为Jalapeño的推理芯片,2024年年中启动设计,2025年11月完成CoWoS封装设计流片。到2026年中,A0版本只经过约3个月真实硅片调试,就在部分模型测试中超过了英伟达Blackwell、AMD和Google的相关芯片。OpenAI预计从2027年开始逐步放量。

这不是一颗只适配OpenAI模型的专用芯片。按照OpenAI和SemiAnalysis披露的信息,Jalapeño定位为通用推理芯片,可以运行DeepSeek R1、Kimi K2.5、GPT-OSS等模型,也能支持不同的推理负载。

先看性能:优势集中在推理效率

Jalapeño单芯片功耗约700W,配备216 GiB HBM4,内存带宽达到15.4 TB/s,FP8算力约3.4 PFLOPS,FP4算力约13.4 PFLOPS。


它的峰值算力并不是行业最高,但每瓦性能很突出。SemiAnalysis给出的计算显示,Jalapeño的HBM带宽/瓦约22 GB/s/W,FP4 FLOPS/瓦约19.1,均高于表中多数GPU产品。

OpenAI目前最看重的不是单颗芯片能跑多少理论算力,而是在有限电力下能输出多少token。

数据中心扩容越来越受电力约束。新增GPU的速度可能很快,但电网并网、变电站、冷却系统、UPS和备用发电设施的建设周期更长。对模型服务商来说,1兆瓦电力能够产生多少token,已经比单颗芯片的峰值FLOPS更接近收入和成本。

在SemiAnalysis现场看到的测试中,Jalapeño在DeepSeek R1低并发场景下,单用户输出速度超过700 token/s;Kimi K2.5和GPT-OSS部分测试达到约1400 token/s/user。Kimi K2.5测试中,Jalapeño在接近700 token/s/user的位置,约是下一名芯片的9倍。


这些成绩还有一个特点:Jalapeño使用的是单token预测,没有使用多token预测、推测解码,也没有进行Prefill/Decode分离。对比芯片则采用了各自性能最好的配置,其中包括MTP。

不过,不能据此直接得出“Jalapeño全面击败Nvidia”的结论。现有测试主要是8k输入、1k输出的短上下文工作负载,SemiAnalysis没有完成完整的InferenceX测试,也没有看到AgentX结果。长上下文、多轮对话和代理任务会进一步考验路由、Prefix Cache、KV Cache管理、网络和工具调用,这些环节还没有被充分验证。

真正的差异:硬件和软件一起设计

Jalapeño的竞争力不只来自芯片规格,更来自OpenAI把硬件、编译器和推理服务放在一起设计。


在硬件层面,Jalapeño采用权重驻留式脉动阵列,同时支持较小的矩阵维度。相比一些依赖大批量和规整矩阵的加速器,它在模型形状不规则、并发较低时,理论上可以减少填充和切分损失。

芯片内部把计算核心和HBM划分成多个slice,每个核心优先访问自己的本地内存区域,核心之间通过高带宽的集体通信网络同步。OpenAI刻意减少复杂的内存层级和固定延迟,希望在小批量推理时也能接近硬件峰值。

传统GPU往往需要依靠更大的批量,把kernel启动、线程同步和内存访问延迟隐藏起来。Jalapeño的思路相反:先把硬件的固定开销压低,再通过软件把不同形状的计算任务填满。

在编程工具方面,OpenAI使用基于Triton的Gluon语言,并通过Linear Layouts描述张量元素与硬件资源的映射。每个核心还支持预取和乱序执行,软件可以更细地控制数据何时进入计算单元。

早期内核主要由工程师手工编写,之后逐渐转向由内部版本的Codex自动生成和优化。OpenAI还使用Teacup作为内部推理引擎,用gigakernel把多个操作合并到一个持续运行的mega-kernel中,减少CPU调度和kernel启动开销。

这解释了为什么OpenAI可以快速适配新模型。Jalapeño启动时,OpenAI甚至没有现成的MLA内核;在DeepSeek模型进入测试后,团队很快完成了相关内核。报告称,部分工作负载在不到两周内实现了两倍以上的吞吐提升,8天内还完成了从TP8到TP32的扩展。

OpenAI还开发了chilisim模拟器,能够在实际硬件运行前预测性能,报告称模拟结果与实测误差约为5%。这套软件流程,可能比某一代芯片的具体设计更重要。


为什么不做Prefill和Decode分离

目前不少GPU推理系统倾向于把Prefill和Decode放在不同芯片池中。

Prefill主要处理输入,计算密度较高;Decode逐步生成token,更依赖内存带宽和低延迟。把两者拆开,可以针对不同阶段优化硬件配置。

OpenAI选择了另一条路:Prefill和Decode共用同一个芯片池。

原因在于生产流量一直变化。输入和输出长度、并发量、KV Cache命中率、推测解码接受率和延迟目标都不固定。如果芯片被提前分成两个池,一边需求增加时,另一边可能出现大量闲置。

统一芯片池牺牲了一部分理论上的专用效率,却提高了整个资源池的可调度性。Prefill产生的KV Cache也不需要频繁搬运到另一组芯片,可以减少网络带宽、同步和故障隔离成本。

这套设计尤其适合OpenAI这样的服务商:模型更新快,流量结构变化大,而且需要同时处理低延迟请求和高吞吐批处理任务。对于流量稳定的大型推理集群,Prefill/Decode分离仍然可能更有效率,Jalapeño并不是否定这种架构,而是选择了更灵活的资源池。

从芯片到机架,系统设计同样关键

Jalapeño并不是单颗ASIC,而是一套完整的机架系统。


一个ASIC机架包含16个Vindaloo托盘,每个托盘装有8颗芯片,合计128颗Jalapeño;旁边还配有Katsu CPU主机机架和Chana交换机托盘。两机架系统总功耗约160kW。

在机架内部,芯片通过铜背板连接;跨机架扩展则使用1.6T光模块和光路交换机。整个scale-up网络最多可以连接16个机架、2048个XPU。


这种设计为未来更大的模型和更长的上下文保留了扩展空间。报告估算,scale-up网络只占系统总成本约10%,但能够把单机架系统扩展到更大的计算域。

真正的考验也从芯片性能转向了量产和运营:CoWoS产能、HBM4供应、芯片良率、机架部署速度、长期故障率、监控系统以及大规模调度能力,都可能决定Jalapeño能否从工程样片变成稳定的商业平台。

对Nvidia、AMD和Cerebras意味着什么

对Nvidia来说,Jalapeño最大的威胁是推理业务的定价权。

OpenAI是Nvidia的重要客户。过去,OpenAI需要在很大程度上接受Nvidia GPU的价格、交付节奏和系统架构。现在,即使Jalapeño只承担部分推理流量,也能在采购谈判中形成替代选项。

Nvidia仍然拥有供应链规模、CUDA生态、训练和推理兼容性,以及更广泛的客户基础。Jalapeño短期内不可能全面替代GPU。但在推理场景中,客户不再只有“买更多Nvidia”这一条路。

对AMD来说,压力更直接。AMD需要补上的不只是芯片峰值算力,还有内核工程、编译器、模型适配和软件迭代速度。OpenAI在不到一年时间里展示出的开发效率,说明ASIC竞争已经从硬件规格竞争转向完整软件栈竞争。

对Cerebras而言,Jalapeño可能构成更直接的替代。Cerebras依靠大规模片上SRAM实现极高交互速度,但运行超大模型时需要大量Wafer Scale Engine,资本开支和功耗都很高。Jalapeño虽然未必能在每一项延迟指标上超过Cerebras,却可能以更低功耗、更低资本开支和更灵活的统一资源池,提供足够接近的交互体验。

OpenAI目前仍有750MW的Cerebras使用义务,另有额外1.25GW的扩展选项。未来是否继续执行,很大程度上取决于Jalapeño及其后续产品能否在成本和交互速度之间达到更好的平衡。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
同样面对王楚然,白敬亭和王安宇大不同,男人的边界感很珍贵

同样面对王楚然,白敬亭和王安宇大不同,男人的边界感很珍贵

椰黄娱乐
2026-08-25 11:01:36
仅剩1年合同,名记:杨瀚森新赛季进不了轮换,要等到第3年才会像一个NBA球员

仅剩1年合同,名记:杨瀚森新赛季进不了轮换,要等到第3年才会像一个NBA球员

喜欢体育的猫
2026-08-26 11:36:37
中国第二届机器人运动会,为什么让印度媒体和网友大面积破防了?

中国第二届机器人运动会,为什么让印度媒体和网友大面积破防了?

面包夹知识
2026-08-24 18:08:22
比看病贵更可怕的是,未来可能找不到好医生了

比看病贵更可怕的是,未来可能找不到好医生了

混沌录
2026-08-26 11:34:09
卓伟爆终极内娱大瓜!两对夫妻全员出轨互换,邻居变爱人

卓伟爆终极内娱大瓜!两对夫妻全员出轨互换,邻居变爱人

情感大头说说
2026-08-25 04:57:59
比亚迪,突然学坏了?昨晚的发布会上,高管也精准“内涵”了友商

比亚迪,突然学坏了?昨晚的发布会上,高管也精准“内涵”了友商

小李车评李建红
2026-08-26 08:00:06
从177到115斤,我才明白:清掉内脏脂肪,才是瘦下来的根本原因

从177到115斤,我才明白:清掉内脏脂肪,才是瘦下来的根本原因

解说阿洎
2026-08-14 01:01:23
章建平套现40亿走人

章建平套现40亿走人

新浪财经
2026-08-26 09:22:18
中国25岁女留学韩国后续:凶手为“男友”,具体身份曝光,与亲属聊天内容公布

中国25岁女留学韩国后续:凶手为“男友”,具体身份曝光,与亲属聊天内容公布

李晚书
2026-08-26 11:57:18
80岁的美国乡村音乐传奇多莉·帕顿去世,特朗普:全美降半旗一周

80岁的美国乡村音乐传奇多莉·帕顿去世,特朗普:全美降半旗一周

界面新闻
2026-08-26 07:15:21
工行、农行、中行、建行、邮储银行,发布公告!

工行、农行、中行、建行、邮储银行,发布公告!

中国基金报
2026-08-26 11:44:11
放弃美国绿卡回国:落选院士后,他霸气宣告:永不参选!

放弃美国绿卡回国:落选院士后,他霸气宣告:永不参选!

奇怪的鲨鱼们
2026-08-24 21:57:29
老年人过夫妻生活时,要注意哪些问题?医生提醒:4件事不能大意

老年人过夫妻生活时,要注意哪些问题?医生提醒:4件事不能大意

周哥一影视
2026-08-26 11:50:13
真血债血偿,伊朗暗杀行动已开始,不管谁的儿子,都别想逃出生天

真血债血偿,伊朗暗杀行动已开始,不管谁的儿子,都别想逃出生天

林子说事
2026-08-26 09:56:12
争议!体育巨头前CEO起飞后官宣全家移民美国 巨额财富0税负出境

争议!体育巨头前CEO起飞后官宣全家移民美国 巨额财富0税负出境

念洲
2026-08-26 06:55:07
美媒终于说实话了!中国歼-16战绩恐怖,可能是全球最强四代机!

美媒终于说实话了!中国歼-16战绩恐怖,可能是全球最强四代机!

历史的烟火
2026-08-26 03:48:56
教科书为何删了“离离原上草”后四句?看完原诗,你觉得该删吗?

教科书为何删了“离离原上草”后四句?看完原诗,你觉得该删吗?

历史教堂
2026-08-19 06:12:48
唐嫣罗晋这对真离了 ?女方父母不让罗晋爸妈碰娃,双方都有问题

唐嫣罗晋这对真离了 ?女方父母不让罗晋爸妈碰娃,双方都有问题

八星人
2026-08-24 14:29:56
47岁李娟现状:在新疆隐居,不生娃不上班,已10年没见过母亲

47岁李娟现状:在新疆隐居,不生娃不上班,已10年没见过母亲

慕名而来只为你
2026-08-18 12:17:30
有史以来最强的厄尔尼诺进入倒计时!2026年冬天,中国将面临什么

有史以来最强的厄尔尼诺进入倒计时!2026年冬天,中国将面临什么

抽象派大师
2026-08-25 17:11:50
2026-08-26 13:08:49
普陀动物世界
普陀动物世界
感恩相识 感恩你对我的关注
1105文章数 13921关注度
往期回顾 全部

科技要闻

OpenAI首颗芯片炸场:第一代就杀进前沿

头条要闻

牛弹琴:加拿大反击了 特朗普勃然大怒做最戏剧性举动

头条要闻

牛弹琴:加拿大反击了 特朗普勃然大怒做最戏剧性举动

体育要闻

B费当选PFA最佳球员 曼联近16年首人

娱乐要闻

韩沛颖风波发酵,大学同学揭开细节

财经要闻

宗馥莉汽水铺销售遇冷

汽车要闻

220万台交付 GL8陆尊/至境世家发布限时焕新置换价

态度原创

游戏
艺术
时尚
亲子
家居

米哈游不做二次元!《源初之结》组队狩猎神话生灵

艺术要闻

丁一林 油画风景写生新作(2026年5~7月)

夏天衣服不用买贵的,看看这几款针织短袖,舒适百搭又显得温柔

亲子要闻

十年科研攻关 宝宝馋了以创新定义行业标准

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版