![]()
我们好久没有写SemiAnalysis的newsletter的文章解读了,主要原因是最近几篇文章,我感觉意思不大。但今天这篇,关于OpenAI的自研芯片,确实值得好好看一看,文章标题也起的比较夸张,但真的是很多地方超出了我的预期。
OpenAI自研芯片这事,我们一直在跟踪,从他们开始流片、回片,到有新闻说他们9个月设计出了这个芯片,我都觉得还算是正常节奏,说句站着不腰疼的话:这个芯片无非就是买买接口IP,在现在AI coding能力这么强的背景下,大幅缩短芯片设计和验证周期,都合理。
先说几个SA的观点,后面再详细解释。
1、它是通用推理芯片,不是 OpenAI 私有专用芯片。它可以跑 DeepSeek R1、Kimi‑K2.5、GPT‑OSS 等第三方开源模型,甚至用 Codex 简单提示词就能移植 Doom 游戏。并不是锁死 OpenAI 自家模型;只是它不做训练,只做推理。
2、现在行业共识基本都是推理做Prefill‑Decode 解耦。prefill是计算密集,decode是带宽密集;把硬件拆成两组独立池子,分别优化,才能拉高 GPU 利用率;英伟达 Dynamo、大量云厂商都往这个方向走,解耦似乎是未来推理架构标准答案。但Jalapeño 选择完全同质、可流动的算力池,拒绝固定 PDD 硬件拆分。
3、软件的协同,也是超出预期。大家都知道我们的国产AI芯片,其实很大的问题都是在软件上。
4、CUDA的护城河“可能正在失效”。
5、SA认为把Jalapeño与Blackwell比较,并不公平,而应该对标Rubin。
6、Jalapeño预计从2027年开始逐步放量,大部分产出安排在2027年年底。
SA文章中也讲了关于这个芯片的互联(哪里用铜,哪里用光,周四直播的时候我们可以讲一下),以及对业内其他友商的影响,比如NV、AMD等。
这颗名为Jalapeño的推理芯片,2024年年中启动设计,2025年11月完成CoWoS封装设计流片。到2026年中,A0版本只经过约3个月真实硅片调试,就在部分模型测试中超过了英伟达Blackwell、AMD和Google的相关芯片。OpenAI预计从2027年开始逐步放量。
这不是一颗只适配OpenAI模型的专用芯片。按照OpenAI和SemiAnalysis披露的信息,Jalapeño定位为通用推理芯片,可以运行DeepSeek R1、Kimi K2.5、GPT-OSS等模型,也能支持不同的推理负载。
先看性能:优势集中在推理效率
Jalapeño单芯片功耗约700W,配备216 GiB HBM4,内存带宽达到15.4 TB/s,FP8算力约3.4 PFLOPS,FP4算力约13.4 PFLOPS。
![]()
它的峰值算力并不是行业最高,但每瓦性能很突出。SemiAnalysis给出的计算显示,Jalapeño的HBM带宽/瓦约22 GB/s/W,FP4 FLOPS/瓦约19.1,均高于表中多数GPU产品。
OpenAI目前最看重的不是单颗芯片能跑多少理论算力,而是在有限电力下能输出多少token。
数据中心扩容越来越受电力约束。新增GPU的速度可能很快,但电网并网、变电站、冷却系统、UPS和备用发电设施的建设周期更长。对模型服务商来说,1兆瓦电力能够产生多少token,已经比单颗芯片的峰值FLOPS更接近收入和成本。
在SemiAnalysis现场看到的测试中,Jalapeño在DeepSeek R1低并发场景下,单用户输出速度超过700 token/s;Kimi K2.5和GPT-OSS部分测试达到约1400 token/s/user。Kimi K2.5测试中,Jalapeño在接近700 token/s/user的位置,约是下一名芯片的9倍。
![]()
这些成绩还有一个特点:Jalapeño使用的是单token预测,没有使用多token预测、推测解码,也没有进行Prefill/Decode分离。对比芯片则采用了各自性能最好的配置,其中包括MTP。
不过,不能据此直接得出“Jalapeño全面击败Nvidia”的结论。现有测试主要是8k输入、1k输出的短上下文工作负载,SemiAnalysis没有完成完整的InferenceX测试,也没有看到AgentX结果。长上下文、多轮对话和代理任务会进一步考验路由、Prefix Cache、KV Cache管理、网络和工具调用,这些环节还没有被充分验证。
真正的差异:硬件和软件一起设计
Jalapeño的竞争力不只来自芯片规格,更来自OpenAI把硬件、编译器和推理服务放在一起设计。
![]()
在硬件层面,Jalapeño采用权重驻留式脉动阵列,同时支持较小的矩阵维度。相比一些依赖大批量和规整矩阵的加速器,它在模型形状不规则、并发较低时,理论上可以减少填充和切分损失。
芯片内部把计算核心和HBM划分成多个slice,每个核心优先访问自己的本地内存区域,核心之间通过高带宽的集体通信网络同步。OpenAI刻意减少复杂的内存层级和固定延迟,希望在小批量推理时也能接近硬件峰值。
传统GPU往往需要依靠更大的批量,把kernel启动、线程同步和内存访问延迟隐藏起来。Jalapeño的思路相反:先把硬件的固定开销压低,再通过软件把不同形状的计算任务填满。
在编程工具方面,OpenAI使用基于Triton的Gluon语言,并通过Linear Layouts描述张量元素与硬件资源的映射。每个核心还支持预取和乱序执行,软件可以更细地控制数据何时进入计算单元。
早期内核主要由工程师手工编写,之后逐渐转向由内部版本的Codex自动生成和优化。OpenAI还使用Teacup作为内部推理引擎,用gigakernel把多个操作合并到一个持续运行的mega-kernel中,减少CPU调度和kernel启动开销。
这解释了为什么OpenAI可以快速适配新模型。Jalapeño启动时,OpenAI甚至没有现成的MLA内核;在DeepSeek模型进入测试后,团队很快完成了相关内核。报告称,部分工作负载在不到两周内实现了两倍以上的吞吐提升,8天内还完成了从TP8到TP32的扩展。
OpenAI还开发了chilisim模拟器,能够在实际硬件运行前预测性能,报告称模拟结果与实测误差约为5%。这套软件流程,可能比某一代芯片的具体设计更重要。
![]()
为什么不做Prefill和Decode分离
目前不少GPU推理系统倾向于把Prefill和Decode放在不同芯片池中。
Prefill主要处理输入,计算密度较高;Decode逐步生成token,更依赖内存带宽和低延迟。把两者拆开,可以针对不同阶段优化硬件配置。
OpenAI选择了另一条路:Prefill和Decode共用同一个芯片池。
原因在于生产流量一直变化。输入和输出长度、并发量、KV Cache命中率、推测解码接受率和延迟目标都不固定。如果芯片被提前分成两个池,一边需求增加时,另一边可能出现大量闲置。
统一芯片池牺牲了一部分理论上的专用效率,却提高了整个资源池的可调度性。Prefill产生的KV Cache也不需要频繁搬运到另一组芯片,可以减少网络带宽、同步和故障隔离成本。
这套设计尤其适合OpenAI这样的服务商:模型更新快,流量结构变化大,而且需要同时处理低延迟请求和高吞吐批处理任务。对于流量稳定的大型推理集群,Prefill/Decode分离仍然可能更有效率,Jalapeño并不是否定这种架构,而是选择了更灵活的资源池。
从芯片到机架,系统设计同样关键
Jalapeño并不是单颗ASIC,而是一套完整的机架系统。
![]()
一个ASIC机架包含16个Vindaloo托盘,每个托盘装有8颗芯片,合计128颗Jalapeño;旁边还配有Katsu CPU主机机架和Chana交换机托盘。两机架系统总功耗约160kW。
在机架内部,芯片通过铜背板连接;跨机架扩展则使用1.6T光模块和光路交换机。整个scale-up网络最多可以连接16个机架、2048个XPU。
![]()
这种设计为未来更大的模型和更长的上下文保留了扩展空间。报告估算,scale-up网络只占系统总成本约10%,但能够把单机架系统扩展到更大的计算域。
真正的考验也从芯片性能转向了量产和运营:CoWoS产能、HBM4供应、芯片良率、机架部署速度、长期故障率、监控系统以及大规模调度能力,都可能决定Jalapeño能否从工程样片变成稳定的商业平台。
对Nvidia、AMD和Cerebras意味着什么
对Nvidia来说,Jalapeño最大的威胁是推理业务的定价权。
OpenAI是Nvidia的重要客户。过去,OpenAI需要在很大程度上接受Nvidia GPU的价格、交付节奏和系统架构。现在,即使Jalapeño只承担部分推理流量,也能在采购谈判中形成替代选项。
Nvidia仍然拥有供应链规模、CUDA生态、训练和推理兼容性,以及更广泛的客户基础。Jalapeño短期内不可能全面替代GPU。但在推理场景中,客户不再只有“买更多Nvidia”这一条路。
对AMD来说,压力更直接。AMD需要补上的不只是芯片峰值算力,还有内核工程、编译器、模型适配和软件迭代速度。OpenAI在不到一年时间里展示出的开发效率,说明ASIC竞争已经从硬件规格竞争转向完整软件栈竞争。
对Cerebras而言,Jalapeño可能构成更直接的替代。Cerebras依靠大规模片上SRAM实现极高交互速度,但运行超大模型时需要大量Wafer Scale Engine,资本开支和功耗都很高。Jalapeño虽然未必能在每一项延迟指标上超过Cerebras,却可能以更低功耗、更低资本开支和更灵活的统一资源池,提供足够接近的交互体验。
OpenAI目前仍有750MW的Cerebras使用义务,另有额外1.25GW的扩展选项。未来是否继续执行,很大程度上取决于Jalapeño及其后续产品能否在成本和交互速度之间达到更好的平衡。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.