网易首页 > 网易号 > 正文 申请入驻

OpenAI公布首颗自研推理芯片成绩,下一代已进入制造阶段

0
分享至



8 月 25 日,OpenAI 公布了首款自研 AI 推理芯片 Jalapeño 的首批性能测试结果。

两个月前,OpenAI 与博通首次正式发布 Jalapeño。当时 OpenAI 只披露了较为概括的早期测试结果,称其第一代加速器每瓦性能将明显高于当时的先进水平。此次更新则首次给出了 Jalapeño 在多款公开大模型上的具体测试数据,包括 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T。

Jalapeño 是 OpenAI 第一款自研推理芯片,主要针对大语言模型推理设计。OpenAI 负责芯片架构设计,博通参与芯片实现、网络和连接技术,Celestica 则负责板卡、机架和系统集成等工作。OpenAI 此前表示,从初始设计到完成流片,Jalapeño 大约用了 9 个月。

为了解 Jalapeño 的实际性能,OpenAI 使用 SemiAnalysis 的公开基准测试工具 InferenceX 对其进行了测试,并将其与英伟达 GB200、GB300 系统进行比较,测试范围涵盖了从高吞吐量服务到高交互性、低延迟的应用场景。

SemiAnalysis 甚至在一份文档中写道:“在我们测试过的所有 Nvidia、AMD 和 Google 芯片上,OpenAI 在多个顶级开源模型上的表现都优于它们。”

从整体结果看,Jalapeño 最突出的特点是,在较低功耗下,同时实现了更高的推理吞吐量和更低的生成延迟。

OpenAI 公布的数据显示,在此次测试的三款模型上,Jalapeño 的峰值每瓦吞吐量是对比系统的 1.5 至 1.9 倍。与此同时,在强调低延迟和单用户生成速度的测试中,其表现也高于对比系统。

以 OpenAI 自己发布的 GPT-OSS 120B 为例,Jalapeño 的对比对象是英伟达 GB200。在峰值吞吐量下,Jalapeño 每千瓦最高可以处理约 8.54 万个 token/s,GB200 约为 4.5 万个,前者约为后者的 1.9 倍。


(来源:OpenAI)

在生成速度方面,Jalapeño 连续两个 token 之间的最短时间间隔为 0.69 毫秒,相当于单个用户每秒最高可以生成约 1,459 个 token;GB200 的这一数字约为 535 个 token/s。

在参数规模更大的 DeepSeek R1 上,OpenAI 将 Jalapeño 与 GB300 进行了比较。Jalapeño 的峰值每千瓦吞吐量约为 1.96 万 token/s,GB300 约为 1.18 万,前者约高 1.7 倍。

在低延迟状态下,Jalapeño 的单用户生成速度最高约为 700 token/s,GB300 约为 169 token/s,前者约为后者的 4.1 倍。


(来源:OpenAI)

测试中最大的模型是拥有约 1 万亿参数的 Kimi K2.5。在这款模型上,Jalapeño 每千瓦峰值吞吐量约为 1.82 万 token/s,GB300 约为 1.19 万,前者约高 1.5 倍。

在单用户生成速度上,Jalapeño 最高约为 694 token/s,GB300 约为 182 token/s,差距约为 3.8 倍。最低端到端延迟分别为 1.56 秒和 5.31 秒。

除了比较各自的最高性能,OpenAI 还给出了另一组测试结果:如果让 Jalapeño 和对比系统保持相同的单用户生成速度,再比较它们可以同时处理多少推理任务,Jalapeño 的吞吐量差距会进一步扩大。

以 DeepSeek R1 为例,当两套系统都维持在约 169 token/s 的单用户生成速度时,Jalapeño 每千瓦可以处理约 1.23 万 token/s,而 GB300 约为 118。按照这一口径计算,Jalapeño 的吞吐量达到 GB300 的约 104 倍。

在 GPT-OSS 120B 和 Kimi K2.5 上,类似测试得到的差距分别约为 53.7 倍和 56.1 倍。


(来源:OpenAI)

不过,这组数字并不意味着 Jalapeño 的芯片计算性能本身比 GB300 高 104 倍。它反映的是,在保持相同单用户生成速度的情况下,Jalapeño 能够同时承载更多推理任务。

功耗是此次测试中另一项重要指标。

Jalapeño 的额定功耗为 700W,此次作为对比的英伟达 GB200 和 GB300 分别按照 1,200W 和 1,400W 计算。OpenAI 表示,在实际测试中,Jalapeño 的持续功耗没有超过 550W,但计算每瓦性能时仍统一按照 700W 的额定功耗进行比较。

SemiAnalysis 此次进入 OpenAI 实验室查看了 Jalapeño,并现场验证了 InferenceX 的运行。目前测试使用的仍是 A0 版工程芯片,下一版 B0 已进入制造阶段。SemiAnalysis 披露,B0 采用台积电 N3P工艺,MXFP4 理论算力达到 13.4 PFLOPS,额定功耗仍为 700W。

内存方面,Jalapeño 将搭载 HBM4,单封装内存带宽约为 15.4TB/s,并配有独立 I/O 芯片,负责机架内和跨机架通信。

在推理架构上,Jalapeño 由同一套加速器完成 prefill 和 decode 两个阶段,也就是既负责处理用户输入,也负责后续逐个生成 token,而不是分别交给不同类型的芯片。

软件适配方面,此次测试的三款模型并非全部来自 OpenAI。除 GPT-OSS 120B 外,DeepSeek R1 和 Kimi K2.5 均来自外部团队。OpenAI 表示,团队借助 Codex 和 GPT-Astra,在大约两个月内完成了这些模型的移植和优化。

AI 也参与了芯片软件优化。OpenAI 披露,在 GPT-OSS 的部分 attention 和 MoE 模块中,由 AI 生成的 kernel 比此前人工专家编写的版本快 1.5 至 1.8 倍。不过这一提升只针对部分模块,并不代表整个模型获得相同比例的性能提升。

目前,Jalapeño 仍处于正式部署前的生产认证和软件完善阶段。SemiAnalysis 也指出,此次公开的主要性能数据由 OpenAI 提供,虽然其在现场验证了 InferenceX 的运行,但并未独立完成全部测试。

此外,目前公开结果主要来自约 8k 输入、1k 输出的单轮推理场景。对于更长上下文、多轮交互等智能体工作负载,OpenAI 尚未公布测试结果。

按照计划,第一代 Jalapeño 将在 2026 年底前开始部署到 OpenAI 自有计算基础设施中。第二代产品已经进入深入开发阶段,第三代也已开始规划。与此同时,OpenAI 表示,未来仍将继续使用英伟达及其他合作伙伴提供的芯片。

1.https://substack.com/home/post/p-212647373

2.https://openai.com/index/jalapeno-first-results/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
炸了!李安《金山》低调杀青,真实阵容曝光那一刻,全网都愣了

炸了!李安《金山》低调杀青,真实阵容曝光那一刻,全网都愣了

草莓解说体育
2026-08-26 10:31:28
57分狂胜韩国队!女篮96比39掀翻对手:16岁天才中锋独揽29分

57分狂胜韩国队!女篮96比39掀翻对手:16岁天才中锋独揽29分

篮球快餐车
2026-08-26 21:11:34
棋牌店老板娘的死局:不管扶不扶,她都会被赖上,从老人坐她家开始,她就已经逃不掉了

棋牌店老板娘的死局:不管扶不扶,她都会被赖上,从老人坐她家开始,她就已经逃不掉了

壹只灰鸽子
2026-08-25 09:21:46
12.8亿卖掉总统,卖掉工厂,卖掉国家,两年后两发子弹穿胸而过

12.8亿卖掉总统,卖掉工厂,卖掉国家,两年后两发子弹穿胸而过

墨策讲历史
2026-08-21 19:27:44
中印边界问题特别代表第25次会晤达成8点成果共识

中印边界问题特别代表第25次会晤达成8点成果共识

澎湃新闻
2026-08-26 23:26:04
西藏吉隆县遭受泥石流灾害,造成重大人员伤亡、失联;亲历游客:突然听到山体被撕裂的轰鸣声,泥浆夹杂树木和铁皮,流速很快

西藏吉隆县遭受泥石流灾害,造成重大人员伤亡、失联;亲历游客:突然听到山体被撕裂的轰鸣声,泥浆夹杂树木和铁皮,流速很快

极目新闻
2026-08-26 20:05:36
杨超越在工厂打工时候的照片曝光!网友炸了:这妥妥的厂花啊!

杨超越在工厂打工时候的照片曝光!网友炸了:这妥妥的厂花啊!

黎兜兜
2026-08-25 22:25:21
大开眼界!许家印当年奢靡生活曝光

大开眼界!许家印当年奢靡生活曝光

麦杰逊
2026-08-23 15:09:25
刚才查了下“紫苏”不查不知道,查完我下楼把墙角那几棵全收了

刚才查了下“紫苏”不查不知道,查完我下楼把墙角那几棵全收了

三农老历
2026-08-26 01:48:17
刘亦菲39岁生日大片被赞优雅茜茜公主!唐嫣连续12年为茜茜庆生

刘亦菲39岁生日大片被赞优雅茜茜公主!唐嫣连续12年为茜茜庆生

妙知
2026-08-26 01:29:55
西藏吉隆口岸附近发生泥石流 失联人员或有道路施工者

西藏吉隆口岸附近发生泥石流 失联人员或有道路施工者

红星新闻
2026-08-26 16:33:42
爸爸几年如一日给女儿发:“大肥猫发给我”,刚开始以为爸爸是猫瘾太重,结果没想到...知道真相后笑着哭了

爸爸几年如一日给女儿发:“大肥猫发给我”,刚开始以为爸爸是猫瘾太重,结果没想到...知道真相后笑着哭了

铲屎官阿伟
2026-08-26 10:15:10
我们要当心了!万斯很可能成为下一届美国总统,一旦他当上总统,就不只是天天制造戏剧化闹剧,而是进一步把特朗普主义彻底固化

我们要当心了!万斯很可能成为下一届美国总统,一旦他当上总统,就不只是天天制造戏剧化闹剧,而是进一步把特朗普主义彻底固化

扶苏聊历史
2026-08-25 15:35:19
伊朗总统亲口曝出惊天猛料:哈梅内伊“临终遗愿”是和美国谈和

伊朗总统亲口曝出惊天猛料:哈梅内伊“临终遗愿”是和美国谈和

爱吃醋的猫咪
2026-08-25 17:09:54
中方敦促在斯威士兰的中国公民撤离,外交部介绍情况

中方敦促在斯威士兰的中国公民撤离,外交部介绍情况

澎湃新闻
2026-08-26 16:32:13
太扎心了!“在上海断子绝孙简直就是家常便饭”,一句刺耳的网络吐槽,评论区炸锅

太扎心了!“在上海断子绝孙简直就是家常便饭”,一句刺耳的网络吐槽,评论区炸锅

火山詩话
2026-08-25 16:18:38
“和稀泥”换不来稳定

“和稀泥”换不来稳定

第一财经资讯
2026-08-26 15:05:02
我在医院上班20年了,今天告诉大家:现在的艾滋病,真的是太多了

我在医院上班20年了,今天告诉大家:现在的艾滋病,真的是太多了

千秋文化
2026-08-25 20:41:32
武汉公开赛战报!5-2,5-3赵心童,塞尔比晋级,16强出炉中国5席

武汉公开赛战报!5-2,5-3赵心童,塞尔比晋级,16强出炉中国5席

领悟看世界
2026-08-26 02:44:01
注意,做完增强CT的留置针不能马上取!但为什么?

注意,做完增强CT的留置针不能马上取!但为什么?

护理传真
2026-08-25 22:26:33
2026-08-27 01:04:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17144文章数 515196关注度
往期回顾 全部

科技要闻

DeepSeek被曝前七个月收入4.75亿元

头条要闻

央视:政务App日活用户仅60人 当地投4670万"打水漂"

头条要闻

央视:政务App日活用户仅60人 当地投4670万"打水漂"

体育要闻

兑现五年之约,含梗量最高的世界冠军诞生

娱乐要闻

包文婧当初担心包贝尔出轨,预言成真

财经要闻

洪灏:人民币是全球最被低估的货币

汽车要闻

北京现代吴周涛:艾尼氪V,中国定义专为年轻人打造

态度原创

艺术
家居
手机
本地
公开课

艺术要闻

加拿大震惊业界!北美最高抗震木结构办公楼亮相

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

iPhone 17系列蝉联全球季度最畅销机型 苹果三星共同占据全球手机销量25%以上

本地新闻

无印良品竟是桐乡造?这座小城藏着一个刀具帝国

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版