网易首页 > 网易号 > 正文 申请入驻

OpenAI“辣椒芯”比肩英伟达,苹果也来凑AI芯片热闹了

0
分享至


就在刚刚,硅谷发生了一件重磅的事:两家公司研发的AI芯片,全面硬刚英伟达。

就在刚刚,OpenAI公布自研AI推理芯片Jalapeño(翻译为:墨西哥辣椒)最新测试结果称,该芯片在InferenceX 基准测试中击败英伟达 GB200、GB300 超级芯片,在 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5 1T等模型上,每瓦 AI 工作量达到竞品(猜测是英伟达GPU)的1.5-1.9倍,端到端延迟降低1.7-3.6倍。


换句话说,这颗OpenAI与 博通合作开发的 ASIC 架构 Jalapeño带来的AI推理算力,超过了英伟达。

当然,这颗芯片至今还未全面部署。OpenAI 计划于今年年底小规模部署,2027 年扩大产量,并继续开发第二、第三代芯片。不过,公司强调不会完全取代英伟达等合作伙伴的芯片。

与此同时,苹果也来凑AI芯片热闹了。今晚苹果发布的Mac Mini和Mac Ultra,搭载全新的M6和M5 Ultra芯片。


其中,M5 Ultra首次在M系列SOC中采用了新一代 UltraFusion技术,实现了四芯片架构,包含高达36核的CPU和高达80核的GPU,以及高达1.2TB/s的统一内存带宽,比M3 Ultra提升了50%。最高支持512GB的统一内存,支持数千亿参数的大模型。

M6是苹果首款采用2纳米制程工艺的顶级芯片,配备了更大的12核CPU复合体、更大的12核GPU、双16核神经网络引擎,以及高达170GB/s(上一代M5为153GB/s)的统一内存带宽。最高支持32GB的统一内存。


苹果称M5 Max和M5 Ultra是“苹果迄今最强大的芯片”。

换句话说,苹果的M5 和M6,就是首颗为AI诞生的Mac终端芯片,也是库克卸任前的“大礼”。


刚刚,知名半导体博客SemiAnalysis还发了长文,直言OpenAI Jalapeño会对英伟达产生威胁。

在SemiAnalysis 的 InferenceX 测试里,Jalapeño跑GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 时,在相同功耗下,Jalapeño 每秒能处理的Token数量比英伟达高1.5~1.9 倍,完成一次完整响应的速度也快 1.7~3.6 倍。


如果更看重实时响应,差距还会拉大。比如模型快速连续吐字、Agent 不停调用工具时,Jalapeño 的单用户 Token 输出速度最高达到 GB300 的 4.1 倍。DeepSeek R1 上,两边分别达到约 700 和 169 Token/s。


AI 也参与了这颗芯片的开发。

OpenAI 称,从开始设计到流片只用了 9 个月;之后又用 Codex 和 GPT-Astra,在两个月内适配了 3 个原计划之外的开放权重模型。部分由 AI 写出的计算模块,速度比人类专家版本快 1.5~1.8 倍。

“利用 Codex 和 GPT-Astra,团队在两个月内将三个原本不在 Jalapeño 最初生产计划中的开源权重模型实现了高性能运行。这既展现了架构的灵活性,也体现了人工智能在编程方面的强大能力。对于选定的 GPT-OSS 注意力机制和混合专家模型模块,人工智能生成的实现比现有的人工专家编写的实现快 1.5 到 1.8 倍。这些数据适用于选定的模块,而非整个模型,但它们表明了一种强大的全新开发循环。”

在所有三个公开测试模型中,Jalapeño 在测试的运行范围内均实现了更高的每瓦性能和更低的延迟,处于帕累托前沿。为了确保系统间比较的一致性,我们使用每个加速器的芯片额定功率对结果进行了标准化处理。Jalapeño 的额定功率为 700 瓦,但在测试的工作负载下,其持续功耗始终保持在 550 瓦或以下。


整个混合集群效率提升更高,相比其他厂商增长了53倍-104倍。

目前,Jalapeño 在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上均表现出色。在我们测试过的最大公开模型 Kimi 上,其每瓦峰值性能比对比系统高出约 1.5 倍,端到端延迟降低了约 3.4 倍。在我们的内部测试中,Jalapeño 在 OpenAI 的前沿模型上的优势进一步扩大,这表明随着工作负载规模的扩大和要求的提高,该架构的价值也日益凸显。







不过,这还不能说 OpenAI 已经能和英伟达掰手腕。

Jalapeño 只是推理芯片,而且对比的是英伟达上一代 Blackwell 芯片。SemiAnalysis 认为,其更合理的对手其实是已经开始出货的英伟达Rubin GPU。

当然OpenAI也明确表示,之后仍会大量使用英伟达等公司的芯片。

但有点像苹果和高通、英特尔的关系,苹果脱离其他芯片公司,只是战略、生态、使用比例和时间问题。

以下是 SemiAnalysis原文,有小幅删减。

事实上,今年6月, OpenAI与博通合作推出了一款芯片项目,该芯片从零开始设计,专为LLM推理而打造。设计工作于2024年中期启动,从组建团队到最终流片仅用了约16个月,ASIC芯片的开发周期极短。

通常来说,第一代芯片缺乏竞争力,但 OpenAI 却打破了这一常规,成为行业领先者,在我们测试过的所有 Nvidia、AMD 和 Google 芯片上,OpenAI 在多个顶级开源模型上的表现都优于它们。

OpenAI 之所以能做到这一点,得益于其极致的软硬件协同设计。令人惊讶的是,OpenAI 并没有过度专注于模型推理的任何特定环节,而是致力于打造一款在所有场景下都能提供高性能的通用芯片。

本文将深入探讨 Jalapeño 在 InferenceX 上的架构细节、软件细节和性能结果。

大家都说,OpenAI 的芯片是专门为 OpenAI 模型设计的,但这是错误的,OpenAI 制造了一款用于 AI 推理的通用芯片。

这时间表简直不可思议。这表明,人工智能确实能加速芯片设计的说法并非空穴来风。尽管时间表如此之快,但OpenAI投入了大量资金,做出了务实的设计决策,而且他们的团队实力雄厚,所以取得这样的成绩并不令人意外。

单从规格来看,它就是个强有力的竞争者:



而HBM4的使用使其性能足以媲美NVIDIA和AMD的旗舰级GPU:

媒体对这款芯片的报道大多源于OpenAI几句不经意的评论,他们声称这款芯片会针对他们的模型进行优化,而其他芯片则不会。

这是错误的。

Jalapeño是一款通用推理芯片,能够运行各种模型和各种工作负载,包括基准测试InferenceX,曾在实验室里与OpenAI的工程师一起运行过该基准测试。OpenAI甚至开玩笑地向我们展示了它运行Doom游戏,这款游戏只是移植到了他们的芯片上,并只使用了Codex提示符。

以下是主要的每瓦性能 (perf/W) 结果,考察的是每兆瓦 (MW) 的全功能实用性所对应的令牌吞吐量。


Jalapeño芯片遥遥领先于其他所有芯片。所有这些性能均未使用多令牌预测 (MTP) 技术,而图表中的其他芯片则是各自 SKU 的最佳配置,且均启用了 MTP 技术。

Jalapeño 在几乎所有场景下,性能/功耗比都优于 Blackwell,而且无需针对曲线上的任何特定点进行优化。它不仅在低延迟场景下表现出色,在高吞吐量场景下也同样如此。如果与单代币预测结果进行更直接的比较,Jalapeño 更是遥遥领先于所有竞争对手。在低并发场景下,Jalapeño 展现出卓越的交互性,在 DeepSeek R1 模型上,并发数为 1 时,每个用户每秒可处理超过 700 个代币。

令人难以置信的是,这一切都是在单令牌预测 (STP) 的基础上实现的,无需推测性解码,也无需预填充解码分解。除了 DeepSeek R1 之外,我们还测试了其他一些模型,包括 Kimi-K2.5 和 GPT-OSS,它们的运行速度约为 1400 tok/秒/用户。对于所有模型,我们都确认Jalapeño 的GSM8k 评估结果与 Nvidia 芯片的性能相当。

关于这一点,需要说明几点。

首先,所有数据均由 OpenAI 提供。

我们已在实验室中验证了 InferenceX 的运行结果,但并未运行完整的InferenceX基准测试套件,也未查看AgentX 的结果。AgentX 是我们比较芯片性能的首选测试套件,因为它的数据集具有较长的上下文和多轮次特性,能够反映实际生产工作流程中的缓存行为。在 8k1k 数据集上表现良好的框架,在 AgentX 数据集上的表现可能会更差,因为实际生产负载会对路由器、前缀缓存机制、缓存管理、卸载基础设施等组件施加压力。这些组件无法通过单轮次的 8k1k 测试来评估。更多相关信息,请参阅我们的 AgentX 文章。

其次,我们认为将 Jalapeño 与 Blackwell 进行比较并不全面也不公平。Jalapeño 真正的竞争对手是 Rubin 等同样采用 HBM4 的芯片。Vera Rubin 系统目前已经开始向客户发货,而 OpenAI 距离推出 Jalapeño 的工程样品还有一段时间。

因此,性能的真正比较对象应该是Rubin,而不是Blackwell。在某种程度上,我们预期像Jalapeño这样的定制芯片性能会优于Blackwell。正如我们在上个月分析NVIDIA在CoreWeave发布会上所宣称的性能数据的文章中所述, Vera Rubin NVL72的每兆瓦性能是GB200 NVL72的5.4倍。我们将在下文中将Jalapeño与Vera Rubin七月份的性能数据进行比较。

第三,正在测试的模型并非开源前沿模型。NVIDIA 和 AMD 已经发布了使用 AgentX 测试的更大模型(例如 DeepSeek V4 Pro 和 Kimi K3)的测试结果。模型越大、发布时间越近,在新芯片上运行就越复杂。话虽如此,OpenAI 在 Jalapeno 上运行的模型也并非小模型。

绩效分析

OpenAI 的设计目标是提高每瓦性能 (perf/W)。原因很简单:OpenAI 目前受限于数据中心的电力,而非预算或机房空间,因此每兆瓦的代币数量至关重要。

在 2026 年Computex 2026) 上,黄仁勋表示,每瓦性能、可靠性和长寿命是未来 GPU 的核心特性。

他说道:“如果你有 1 吉瓦的电力,那么每瓦吞吐量就意味着收益。” 他还提到,仅仅因为芯片更便宜就选择错误的架构是没有意义的。


英伟达在2026年Hot Chips大会上发表Vera演讲时,展示了同样的营收图表,并强调了这一点:“如今数据中心受限于电力供应。” 电力供应至关重要,并直接影响营收。

运营商无法简单地增加兆瓦级 (MW) 容量,因为增加 GPU 和增加电网容量所需的时间截然不同。

数据中心的电力容量受到诸多限制,例如公用设施互联、基础设施、冷却能力以及 UPS/备用电源设计。

电网延迟往往超过硬件和建设进度,因此需要采用“表后 (BtM)”电力容量:即在数据中心内部建造的燃气轮机和现场发电机。这种容量位于公用设施的电表之后,而不是从公共电网获取。

它允许运营商在无需等待电网互联和公用设施升级的情况下为设施供电,这正是 xAI 的 Colossus 2 数据中心如此依赖“表后 (BtM)”电力容量的原因,尽管其实际电网连接远远滞后。了解更多信息,请参阅我们的能源模型。

由于瓦特等于焦耳每秒,因此 tok/s/MW 可以简化为每焦耳的token数。这使得 tok/s/MW 能够代表系统的效率以及将能量转化为token的能力。


在这方面,即使与 Rubin 相比,Jalapeño 也更胜一筹。OpenAI 的 Jalapeño 的 STP 输出令牌吞吐量(每兆瓦)超过了Vera Rubin 的 MTP 测试结果(NVIDIA 和 CoreWeave 于 7 月公布了该结果)。

它也远超 GB200 的 2025 年 MTP 测试结果。

正如在 Vera Rubin中提到的,之所以将 VR 与 2025 年的 GB200 测试结果进行比较,是因为当时 VR 处于类似的早期开发阶段,而与 2025 年的 GB200 进行比较可以确保软件成熟度保持一致。

基于此逻辑,将Vera Rubin 最新的 2026 年 7 月测试结果、GB200 的 2025 年测试结果以及今天的 Jalapeño 测试结果进行比较。这是一个非常有效的比较,因为这些是 Rubin 目前公开的最佳数据,而 OpenAI 的芯片流片时间晚于 Rubin。OpenAI 和 Rubin 的技术都还不够成熟,因此性能还有提升的空间。


在性能/总拥有成本 (perf/TCO) 方面,Vera Rubin 和 Jalapeño 势均力敌,每美元产出的代币数量几乎相同。

然而,如前所述,Jalapeño 的结果是在未采用推测性解码的情况下获得的,而 Vera Rubin 的结果则采用了推测性解码。推测性解码可以将每个token的成本降低 3 倍以上。当 Jalapeño 实现推测性解码后,其token成本将大幅降低。

当然,这种总拥有成本优势的部分原因在于,Jalapeño 用 博通较低(但仍然很高)的利润率取代了英伟达的高利润率。但这并非全部原因。

例如,Meta 和微软的 AI ASIC 项目尽管投入了更长时间却未能取得成功,这表明成本只是影响因素之一。


在架构方面,OpenAI 选择不将预填充和解码 (PD) 功能分散到不同的芯片池中。草案模型和主模型共享相同的芯片和架构,这种设计理念牺牲了一些理论效率来换取实际操作的流畅性。其原因在于工作负载组合会随时间变化,例如,随着模型发展经历了三个阶段(知识模型、推理模型和智能模型,详见我们最近的文章),输入、缓存写入、缓存读取和输出令牌的比例发生了显著变化。因此,预先选择固定数量的异构预填充芯片和解码芯片可能会导致效率下降。OpenAI 在此架构中采用同构芯片池,并力求使芯片在所有任务上都能保持良好的性能。

确实如此。在 Kimi K2.5(Cursor Composer 2.5 就是基于该芯片)上,Jalapeño 的运算速度接近 700tok/s/user,是性能第二好的芯片(100tok/s/user)的 9 倍以上。


在 GPT-OSS 上,情况更是厉害。Jalapeño 的每兆字节交互吞吐量几乎是 GB200 最高吞吐量的两倍,并发吞吐量更是 GB200 的 50 倍以上,而Jalapeño 的高并发吞吐量数据使用了 EP8。


这些结果令人印象深刻。

不过还是需要指出一些不足之处:它们只是 8k1k 的测试用例,这种工作负载更容易进行调优,而且目前还没有AgentX 的测试用例。正如我们在AgentX文章中提到的,多轮次、长上下文的工作负载会对服务堆栈的更多方面造成压力,例如路由器和前缀缓存。要想在代理工作负载中脱颖而出,还需要进行更多优化。

下面深入研究Jalapeño规格和架构。

所有这些结果都是在Jalapeño芯片A0工艺阶段取得的,当时该项目才进行了9个月。

但目前B0工艺阶段的芯片已经在晶圆厂生产,B0工艺阶段的优化使其每瓦性能比之前的A0工艺提升了约25%。

具体来说,B0工艺阶段的芯片在台积电N3P工艺制造的单个光罩大小的计算芯片上实现了13.4 PFLOPs的MXFP4性能。相比之下,尺寸相近、采用相同工艺节点制造的单个Rubin计算芯片,其高密度Rubin NVFP4性能为17.5 PFLOPs。

考虑到 Jalapeño 的 TDP 仅为 700W,而 Rubin 的 TDP 则高达 900-1150W(每个计算芯片),Jalapeño 的表现更加令人满意。

由于 Jalapeño 的设计重点在于推理而非训练,OpenAI 无需为了最大化 FLOPs 而提高 TDP 也就不足为奇了。

但无论如何,上述数据表明 Jalapeño 能够提供相当可观的峰值理论 FLOPs。

与其他加速器直接比较时,Jalapeño 具有最高的每瓦 HBM 带宽和最高的每瓦 FLOPs,可与 1,800W Rubin Max-Q 配置相媲美:


非封装 I/O 由一个配备 32 条 800G SerDes 通道的 N3E I/O 芯片提供,用于计算架构。其中 24 条通道(600GB/s)用于机架内的本地扩展,8 条通道(200GB/s)用于全局扩展,即 2048 个 XPU 的多机架域。系统 I/O 使用 PCIe Gen 5 连接到 x86 主机 CPU。

Jalapeño 将搭载 HBM4 显存,使其成为继英伟达和 AMD 之后,较早采用该技术的芯片之一,甚至超越了成熟的 TPU 和 Trainium 项目。

Jalapeño 的核心架构原则之一是最大限度地利用 HBM 带宽,因此,如果 HBM 并非最佳选择,则违背了这一目标。

这使得 Jalapeño 的单封装内存带宽高达 15.4TB/s,优于所有其他采用 HBM3E 的加速器。

15.4TB/s 的带宽表明其 HBM4 的引脚速度可达 10Gbps,略胜于英伟达 Rubin 中 HBM4 的 9.6Gbps。

该 HBM 很可能由三星提供。


OpenAI 于 2025 年 11 月完成了 Jalapeño 芯片的流片,更准确地说,是完成了 CoWoS 设计的流片,而不仅仅是顶层芯片。在 2025 年 11 月流片后的 9 个月内,并且仅用了 3 个月的时间在实际芯片上进行调试,OpenAI 就凭借 Jalapeño 取得了非常优异的成果。考虑到该团队的软件栈是从零开始,这一成绩就更加令人印象深刻了。

与此同时,Rubin 的 CoWoS 芯片流片工作已于 2025 年 10 月完成,比预期提前了一个月,但我们目前看到的早期结果仅来自 CoreWeave 的工程样品。

英伟达并未像 OpenAI 那样允许我们进行测试并发布基准测试结果,这表明他们的芯片软件仍不成熟。鉴于 OpenAI 能够在其芯片上快速部署新模型,CUDA 的护城河可能已经不复存在。

它们距离优化还很远,总体而言,Jalapeño 的表现更胜一筹,但并不认为英伟达的硬件性能较差,而是 Jalapeño 的软件开发进度比英伟达更快。

这体现了软硬件协同设计的强大之处,而这正是新兴的 ASIC 实验室团队超越更成熟的商业芯片厂商的关键所在。

出乎意料的是,从零开始或许也让 OpenAI 受益,因为它可以做出全新的架构决策,而无需担心向后兼容性或旧版本软件的问题。

虽然 OpenAI 已拥有Jalapeño的工程样品,但目前的生产计划是逐步增加产量,预计在 2027 年后开始,大部分产量将于明年年底交付。

可以说,OpenAI Jalapeno 是一款真正的高产量 ASIC 芯片。

与Rubin的进度相比,Jalapeño的速度快得惊人。正如之前所示,尽管Rubin起步较早,但Jalapeño的成绩最终还是超过了Rubin。


现在深入分析其架构。

该芯片的矩阵引擎采用 MXFP 数值格式和权重固定脉动阵列,类似于 TPU。但与 TPU 直接比较时,它支持更小的形状/尺寸,这意味着它不会像 TPU 那样,在处理形状怪异的矩阵乘法运算时,在较大的脉动阵列上出现性能断崖式下降的情况。

它还配备了 64 位标量核心和 FP32/INT32 向量核心。OpenAI 还投入资源在芯片托盘级别实现了冗余设计,并在核心和通道级别内置了良率优化机制。

他们声称,在芯片设计过程中,AI 辅助使 SIMD 面积减少了 8%,矩阵引擎面积减少了 10%。

虽然他们没有详细说明具体的工艺/电压/温度 (PVT) 条件,但他们也提到,与初始模块相比,AI 辅助模块在时序和功耗方面均有所改进。

Jalapeño 架构设计着重于消除 KVCache 和权重的内存移动以及固定延迟和开销,以便即使对于小批量或小形状,也能比其他加速器更接近原始峰值浮点运算/带宽。

核心和 HBM 被划分成多个切片,每个核心切片都拥有对其自身 HBM 切片的低延迟本地视图。

切片间的同步通过高带宽专用网络进行。这种极简的内存层次结构已经赋予 Jalapeño 相对于 GPU 的巨大潜在优势,因为 GPU 的内存访问必须遍历复杂的内存系统,导致较大的延迟,而这些延迟必须通过更大的内存结构来分摊或隐藏。

这种选择是可行的,因为通过仔细放置权重和键值,可以将核心之间的同步限制在有限的、已知的、高带宽的通信(例如可以与计算重叠的张量并行通信)上。


此外,还有一个额外的通用片上网络(NOC),用于通用通信和访问可扩展网络。总的来说,与英伟达和谷歌相比,OpenAI 通过简化 NOC 和内存子系统,显著节省了功耗并获得了巨大的性能提升。


在核心层面,OpenAI 描述了一个带有 L1 缓存的乱序执行 (OoO) 核心。这与我们在其他加速器中看到的模式截然不同,后者通常使用软件管理的暂存区,并搭配一些异步 DMA 支持。

这里再次强调,这种设计使得 Jalapeño 可以避免诸如屏障延迟之类的固定开销。

在其他加速器(例如 GPU)中,这些开销需要通过提高每个核心的工作量来隐藏或分摊,从而难以接近原始峰值带宽/浮点运算性能。

权衡之下,Jalapeño 因此依赖于良好的预取机制来确保内存请求的及时到达,但这带来的可预测性降低,也更难推断。

然而,如果 Codex 得到有效利用并能访问详细的追踪数据,那么找到针对特定形状的最佳内核和预取机制可能几乎不需要人工干预。我们认为这正是 OpenAI 能够如此迅速地推出 DeepSeek R1、Kimi K2.5 和 GPT-OSS 的原因所在。

这些核心还支持“小”矩阵维度,这(取决于小到什么程度)应该使其在不同模型和批次维度上更具通用性,降低对矩阵维度对齐、填充开销和分块效率低下的敏感度。

例如,TPU、Trainium 和 Etched 芯片具有非常大的脉动阵列,这可能需要较大的批次或可整除的模型维度来避免分块效率低下。

OpenAI 利用 Jalapeño 专注于消除系统中的固定延迟,以期在帕累托曲线的所有区域实现尽可能接近最优性能。理论上,这可以使他们在多个工作点上比 GPU 更具优势:

在低延迟/小批量推理方面,性能上限有了显著提升,而GPU上的这种推理性能受限于许多固定开销,例如启动延迟、屏障延迟和内存系统延迟。

即使对于大批量或长时间应用,也有一定的潜力接近硬件性能上限。

但需要注意的是,即使理论上可以达到性能上限,实际内核实现该性能可能更加困难。因此,目前看来,可行的方法是:

旨在针对所有工作负载形状实现最高上限性能。

让 Codex 来完成寻找达到该上限的内核的繁琐工作

从 OpenAI 团队在 Jalapeño 上快速启动 InferenceX 工作负载的情况来看,我们对这种方法持乐观态度。

如果 Jalapeño 获得成功,这将强烈表明,业界对编程模型和完美、通用编译器的痴迷已被前沿人工智能模型所否定。

软件

OpenAI 编写 Jalapeño 内核的方式类似于汇编语言。每个内核都经过人工调优,有些内核的代码长达约 3000 行,并辅以正确性检查和自定义清理器。

早期内核开发并非完全自动化,而是人工参与,但随着规模更大、更完善的内部 Codex 版本的推出,这种情况发生了改变。

OpenAI 计划将 Codex 推向企业客户。其内部服务引擎名为“Teacup”。

有趣的是,在 OpenAI 使用 InferenceX 对 DeepSeek 进行基准测试之前,他们并没有 MLA 内核的内部实现。Codex 能够如此快速地编写功能完善且高效的内核(无需 OpenAI 内核工程团队的任何干预),充分展现了该软件流水线的开发能力。

OpenAI 使用 Gluon 语言编写 Jalapeño 程序。

Gluon 是 OpenAI 的核心编程语言。它基于 Triton 构建,保留了 Triton 的 SPMD(单程序多数据)编程模型,同时又提供了底层编程抽象。例如,对于 NVIDIA GPU,Gluon 提供了映射到 PTX 指令的 API,包括 MMA 指令、TMA 指令、mbarrier 机制等等。Gluon 最独特的抽象概念是布局。

一般来说,布局定义了硬件资源(例如 warp 9 的第 5 个寄存器)和张量元素(例如第 6 行第 7 列的张量元素)之间的映射关系。Gluon 的布局抽象基于线性布局(Linear Layouts),这是一种 OpenAI 发明的布局代数。线性布局从数学上形式化了布局的概念,并提供了操作布局的工具。这使得许多功能成为可能,例如可证明正确的布局转换和最优内存交换。

就 Jalapeño 的编程模型而言,每个 Gluon 程序都映射到一个持久线程。我们认为这暗示 Jalapeño 适合持久内核编程模式,在这种模式下,每个程序在多个 tile 上执行,并且由程序员而非硬件调度器来分配工作。

OpenAI 提到了 TensorInfo,这是一种显式编码布局的抽象概念。这很可能就是为 Jalapeño 设计的布局集,它将由线性布局 (Linear Layouts) 提供支持。

最后,每个核心都提供数据预取和解耦的乱序执行单元。例如,用户可以对预取的数据进行等待,该数据被锁定在信号量之后。

命运弄人,像 GPT 5.6 Sol 这样的 OpenAI 模型目前运行在 NVIDIA GPU 上,却被用来设计一款对 CUDA 护城河构成真正威胁的芯片——NVIDIA 自己的 GPU 正在实时地帮助其潜在的继任者到来。

通过时间对比,我们还可以看到 Jalapeño 的开发速度,在不到两周的时间内,某些交互方式的吞吐量就提升了两倍以上。

Jalapeño 团队提供的每个压缩包都蕴藏着无限的惊喜。


不仅内核性能得到了提升,Jalapeño 团队还在短短 8 天内启用了 TP32,在之前 TP8 配置的基础上,从单个系统扩展到大型机架级配置,实现了完整的机架级运行。这样的开发速度着实令人印象深刻。


为了在进行实际硬件运行之前验证性能,OpenAI 还提供了一个名为“chilisim”的模拟器,其精度与实际硬件的测量结果相差不到 5%,该模拟器使用固定宽度的总线。

A0 芯片上的跟踪性能有限,但在 B0 芯片上得到了显著提升,这很可能得益于 A0 芯片上实际运行的输入数据。

工程师们已经演示了 Codex CLI 运行一个名为“Raiku”或“5.3 Codex Spark”的内部模型,其 TPOT 为 1.2 毫秒。

该团队还展示了 Codex 编写的直接在芯片上运行的演示程序:36 FPS 的 Doom、FP32 流体动力学模拟和“Liquid Light”鼠标拖拽可视化。

在模型方面,OpenAI 的内部巨型内核方案(昵称“gigakernel”)围绕一个在设备端循环运行的单个巨型内核构建,以降低 CPU 开销和启动时间。该团队也在进一步探索测试时计算策略,尤其关注如何有效地利用 100 万次部署。

OpenAI 在这些芯片上并没有使用预填充解码分解(PDD),这让很多人感到意外,因为即使在同质硬件上,NVIDIA 和 AMD 的 GPU 性能也能从 PDD 中显著提升。

让我们深入探究一下 Jalapeño 团队为何会做出这样的选择。

当工作负载稳定时,预填充-解码分离 (PDD) 看起来很有吸引力。预填充和解码对硬件的压力不同,因此将每个阶段分配给单独优化的资源池可以提高特定输入/输出比率下的效率。然而,生产流量并不会保持在该比率。输入和输出序列长度、并发性、缓存命中率、推测接受率和延迟目标都会随时间变化。

一旦设备被划分为预填充池和解码池,过多的预填充需求会导致解码芯片闲置,而请求却在排队等待。但过多的解码需求则会产生相反的效果。运营商必须持续预测合适的分配比例,在两侧都预留备用容量,并不断调整系统,因为理想的分配比例始终在变化。

在统一系统中,某些资源在特定阶段可能利用率不足,但每个设备仍然可用,可以响应下一个请求。而在分离式系统中,整个芯片可能仅仅因为属于错误的资源池而处于闲置状态。局部资源利用率看起来更高,但全局资源利用率可能很差。


解耦也会破坏局部性。预填充工作进程会生成一个庞大的键值缓存,解码工作进程需要立即使用该缓存,因此系统必须先通过网络传输该状态,才能继续生成。这会增加带宽消耗、同步、排队以及另一个故障域。

此外,由于键值缓存会增长,成本也会随着输入序列长度的增加而上升。

然而,避免移动键值主要是为了优化功耗和延迟;而允许移动部分键值则可以提高硬件利用率,但代价是增加一些功耗和每次请求的延迟。


可互换的资源配置方案会在对延迟敏感的请求和对吞吐量要求较高的批次处理之间灵活切换资源,而固定的资源配置方案则会在流量组合发生变化时自动分配硬件资源。此外,上下文长度会改变注意力机制和前馈神经网络(FFN)工作之间的平衡,因此任何固定的硬件配置比例只有在接近其设计点时才有效。


同样的限制也适用于推测性解码。草稿模型必须以极低的延迟向验证者提供候选令牌。将两者分别部署在专用池中,可以将紧密耦合的解码循环转变为分布式协议。额外的通信和协调可能会消耗掉草稿节省的延迟。将两个模型都部署在同一设备和低延迟架构上,可以保持推测性解码的根本价值所在——局部性。


然而,在需求足够大、稳定且可预测的情况下,分解处理仍然能够胜出,尤其是在传统GPU需要处理大量特定阶段的批次才能达到良好吞吐量时。但这并非免费午餐。


下面,机架级的Jalapeño系统由一个CPU主机机架和一个ASIC机架组成。

主机机架内设有16个名为“Katsu”的主机CPU托架,每个托架对应位于Katsu右侧的16个ASIC托架之一,这些托架被称为“Vindaloo”。

每个主机机架配备两颗Turin级AMD EPYC CPU、1.5TB DRAM、2个E1.S接口和2个M.2 SSD。

每个托架还配备了400G(2x200G)前端网络。

每个Katsu托架通过8根外部PCIe DAC线缆与每个Vindaloo托架连接,这些线缆水平布置在机架前部。

该系统级设计由Jalapeño与Celestica公司合作完成。

ASIC机架由16个Vindaloo托盘和8个扩展交换托盘(6个用于本地,2个用于全局)组成,名为“Chana”。每个Vindaloo托盘包含8个Jalapeño ASIC,每个机架共包含128个Jalapeño ASIC。ASIC通过铜缆背板连接到每个Chana交换托盘,与Nvidia Oberon的架构类似。扩展拓扑结构分为机架内的128个ASIC的本地域和连接多达16个机架或2048个ASIC的全局域。我们将在下文中更详细地解释带宽和拓扑结构。

为主机机架供电大约需要 50kW 的功率(量产时为 31kW),ASIC 机架需要 130kW 的功率,因此整个双机架系统的总功率约为 160kW。就功率消耗而言,这基本上相当于一个双倍宽度的 GB300 机架。

OpenAI 可以在单个扩展网络中连接多达 2,048 个 Jalapeño XPU。该扩展网络由两个域组成:

一个本地域,通过机架内的背板连接所有 128 个 XPU;以及一个全局域,使用铜缆和光纤混合互连方式,在 16 个机架上连接 2,048 个 XPU。

每个机架包含 8 个 Chana 交换机托架。中间的 6 个 Chana 交换机用于本地域,每个交换机配备一个 102.4T Tomahawk 6 交换机 ASIC。

本地交换机顶部和底部的两个 Chana 交换机用于全局域,我们认为全局域可能包含两个 102.4T Tomahawk 6 交换机,每个交换机托架最多可容纳 204.8T 的交换机。

在本地域中,128 个 Jalapeño 芯片中的每一个都具有 4.8Tb/s 的单向带宽,并以全连接的方式连接到 6 个 102.4Tb/s 的 Tomahawk 6 ASIC。这意味着每个 XPU 需要 48 对差分对 (DP) 公母连接器,每个机架用于本地扩展时总共需要 6,144 对 DP 的无源铜缆。

在全球域中,16 个机架共计 2048 个 XPU 通过铜质背板、204.8T TH6 电气交换机、1.6T 收发器和光路交换机连接在一起。每个 XPU 的全球链路单向带宽为 1.6Tb/s,这相当于每个 XPU 与全球交换机之间的背板上有 16 对差分对 (DP) 公母连接器。每个全球交换机托盘(包含 2 个 ASIC)输出的带宽在背板和前面板光模块之间分配。

在本地域和全局域之间,每个机架的背板连接器数量为每个 XPU 64 个 DP,每个机架总共需要 8,192 个 DP 的无源铜缆。

全球域采用纯轨道架构,由遍布全球域的 8 条轨道组成。我们认为 OpenAI 通过安装在每个机架中的光路交换机 (OCS) 来路由全球域中的光链路。对于每个 XPU,1.6Tb/s 的全球带宽将通过铜质背板传输到全球交换机托架。然后,带宽通过 1.6T 收发器从交换机前面板输出,这些收发器连接到无源光交换机,最后输出到机架。这使得扩展后的全球域规模扩展到 2,048 个 XPU,由 16 个机架组成,每个机架包含 128 个 XPU。


由于扩展网络成本仅占系统总成本的约 10%,这种灵活性为未来 10-20 万亿参数模型或 200-400 万个令牌上下文窗口提供了宝贵的选择。

在部署方面,OpenAI 正与 neoclouds 合作,并与数据中心合作伙伴在 1 月份之前收集可靠性数据,同时优化从对接点到机架的部署时间。

最后谈谈感想。

说句实在话,OpenAI 这颗 Jalapeño 芯片,最坐不住是英伟达。

你想想看,以前 OpenAI 是英伟达最大的客户之一,黄仁勋把最好的 GPU 优先供给它,现在客户自己下场造芯片了,而且专门挑推理这个最大的市场下手。

推理是什么?就是你每次跟 ChatGPT 对话,背后跑的那个计算。

训练是一锤子买卖,烧完就完了,但推理是每天都在烧的钱,用户越多烧得越狠。

OpenAI 算过一笔账,用自己的芯片,推理成本能降一半左右。这意味着什么?以后每多一个用户,OpenAI 付给英伟达的钱就少一分。

英伟达的 CUDA 护城河确实深,但到了 OpenAI 这个体量,软件生态的粘性已经抵不过真金白银的成本差了。说白了,当你一天要烧几百万美元电费的时候,你也会想办法自己造芯片。

但真正值得关注的,不是这颗芯片本身有多强,而是它释放的一个信号:AI 公司开始不满足于做软件了,它们要把硬件也攥在自己手里。

这跟当年苹果从英特尔转到自研 M 系列芯片是一个逻辑 —— 当你大到一定程度,供应链的每一分钱都是你的利润,每一个受制于人的环节都是你的风险。

OpenAI 开了这个头,后面 Anthropic、Google 这些公司只会跟得更快。到时候英伟达面对的就不是一两个客户流失的问题,而是整个商业模式被改写,从“所有人都得买我的 GPU”,变成大客户都自己造芯片了,我只能卖给中小玩家。

那么,市场这么卷了,未来大家到底是做 OpenAI 们的代工厂,还是与英伟达为伍。这个选择,可能比芯片本身更难。

©本文为原创内容

未经授权,禁止转载

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
假如波兰下场,俄军还能撑几天?这么说吧,波兰若出兵乌克兰,等于往俄乌这锅沸腾的油里泼了盆冰水,炸是肯定炸,但谁先糊真不好说

假如波兰下场,俄军还能撑几天?这么说吧,波兰若出兵乌克兰,等于往俄乌这锅沸腾的油里泼了盆冰水,炸是肯定炸,但谁先糊真不好说

扶苏聊历史
2026-08-24 15:33:30
四川省人大常委会原委员、经济委员会原主任委员刘中伯严重违纪违法被开除党籍和公职

四川省人大常委会原委员、经济委员会原主任委员刘中伯严重违纪违法被开除党籍和公职

极目新闻
2026-08-25 19:03:31
太给国产长脸!埃及阵风与中国歼-16对阵,埃及空军直呼大开眼界

太给国产长脸!埃及阵风与中国歼-16对阵,埃及空军直呼大开眼界

面包夹知识
2026-08-26 13:25:42
18号台风沙德尔大北拐,已进入24小时警戒线,19号台风携巨量水汽上岸,暴雨大暴雨确定升级

18号台风沙德尔大北拐,已进入24小时警戒线,19号台风携巨量水汽上岸,暴雨大暴雨确定升级

老牛讲
2026-08-26 14:10:28
仅凭一座大门,卖光2000套房!许家印把河南老乡坑得多惨?

仅凭一座大门,卖光2000套房!许家印把河南老乡坑得多惨?

李云飞Afey
2026-08-24 22:06:40
31岁B费当选PFA最佳球员!成曼联近16年首人 击败哈兰德+阿森纳3将

31岁B费当选PFA最佳球员!成曼联近16年首人 击败哈兰德+阿森纳3将

我爱英超
2026-08-26 05:25:32
太恶心了!又一个场所乱象了:“禁止两人一起洗澡,违者退卡”,一健身房淋浴隔间硬核告示登上热搜

太恶心了!又一个场所乱象了:“禁止两人一起洗澡,违者退卡”,一健身房淋浴隔间硬核告示登上热搜

火山詩话
2026-08-25 15:02:21
智能插座日传1.5GB数据、发起50万次DNS请求,智能设备还值得信任吗

智能插座日传1.5GB数据、发起50万次DNS请求,智能设备还值得信任吗

全栈遛狗员
2026-08-24 20:07:56
越来越好!王曦雨2-1逆转赛会7号种子晋级,排名升至世界第77

越来越好!王曦雨2-1逆转赛会7号种子晋级,排名升至世界第77

里芃芃体育
2026-08-26 09:06:09
打赏陪睡案女主播合租室友发声:魏莹每月陪睡一两次,枕头没干过,经常哭到缺氧

打赏陪睡案女主播合租室友发声:魏莹每月陪睡一两次,枕头没干过,经常哭到缺氧

汉史趣闻
2026-08-24 16:49:25
日本最新研究证实:每天玩手机一小时,学习力全面下降!大脑变懒!高敏感娃更严重!

日本最新研究证实:每天玩手机一小时,学习力全面下降!大脑变懒!高敏感娃更严重!

京城教育圈
2026-08-23 18:37:33
江疏影今日线下活动美拍,脚踩黑色露脚趾高跟真吸睛

江疏影今日线下活动美拍,脚踩黑色露脚趾高跟真吸睛

东方不败然多多
2026-08-26 12:27:55
6.4万买了个寂寞:特斯拉FSD的中国梦,碎了

6.4万买了个寂寞:特斯拉FSD的中国梦,碎了

侃故事的阿庆
2026-08-26 10:49:56
日本代表团抵达北京,一待就是4天,高市11月来华,中方斩钉截铁

日本代表团抵达北京,一待就是4天,高市11月来华,中方斩钉截铁

临云史策
2026-08-26 13:41:15
特朗普宣布:全美降半旗一周

特朗普宣布:全美降半旗一周

环球时报国际
2026-08-26 12:39:36
网友:3次快检全合格,博主一测就超标,菜市场的检测,到底在检测什么?评论区呼吁:必须入刑!

网友:3次快检全合格,博主一测就超标,菜市场的检测,到底在检测什么?评论区呼吁:必须入刑!

谭谈社会
2026-08-25 12:16:37
重庆警方凌晨发布警情通报

重庆警方凌晨发布警情通报

政知新媒体
2026-08-26 08:02:55
郑恺和苗苗的新瓜,炸得很突然

郑恺和苗苗的新瓜,炸得很突然

黎兜兜
2026-08-26 08:15:05
2007年华南虎案周正龙获刑两年半,8年后突然申诉:年画证据被指掉包,审讯细节曝光

2007年华南虎案周正龙获刑两年半,8年后突然申诉:年画证据被指掉包,审讯细节曝光

z千年历史老号
2026-08-25 21:54:52
8角一斤,我买了500斤:晒干后能吃一整年,方法很简单

8角一斤,我买了500斤:晒干后能吃一整年,方法很简单

椰青美食分享
2026-08-25 11:55:36
2026-08-26 15:43:00
智能纪元AGI
智能纪元AGI
专注科技、科学、商业产业报道
2574文章数 10612关注度
往期回顾 全部

科技要闻

OpenAI首颗芯片炸场:第一代就杀进前沿

头条要闻

媒体:嫦娥七号按暂停键 中国航天的"下一盘大棋"浮现

头条要闻

媒体:嫦娥七号按暂停键 中国航天的"下一盘大棋"浮现

体育要闻

B费当选PFA最佳球员 曼联近16年首人

娱乐要闻

韩沛颖风波发酵,大学同学揭开细节

财经要闻

宗馥莉汽水铺销售遇冷

汽车要闻

220万台交付 GL8陆尊/至境世家发布限时焕新置换价

态度原创

本地
家居
亲子
数码
公开课

本地新闻

无印良品竟是桐乡造?这座小城藏着一个刀具帝国

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

4岁女儿没有积木玩,把拼好的积木拆了重新拼,可把爸爸心疼坏了

数码要闻

宠物智能家电迎来健康监测新拐点:零售量同比增长15.6%

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版