网易首页 > 网易号 > 正文 申请入驻

当工程师拒绝更聪明的模型:AI推理大战,OpenAI换了一把"枪"

0
分享至

人工智能推理市场正在经历一场深刻的范式转变——速度,而非智能,正成为开发者愿意为之付费的核心变量。这一偏好的逆转,将长期处于边缘地位的芯片公司Cerebras推向了聚光灯下,也让OpenAI斥资数百亿美元押注一家即将上市的晶圆级芯片制造商。

据行业研究机构SemiAnalysis的深度报告,OpenAI已与Cerebras签署总规模高达750兆瓦算力的主协议,潜在扩展至2吉瓦,对应剩余履约义务达246亿美元。

这笔交易的核心逻辑在于:OpenAI旗下GPT-5.3-Codex-Spark模型在Cerebras硬件上可实现每用户每秒2000个token的生成速度,远超基于HBM的GPU集群所能提供的交互体验。与此同时,Cerebras正站在IPO的门槛上,其命运已与OpenAI深度绑定。

这场速度革命的市场信号已相当清晰。SemiAnalysis披露,其团队80%的AI支出(年化峰值达1000万美元)集中在Anthropic的Opus 4.6快速模式上——该模式以6倍溢价换取2.5倍交互速度。更具说服力的是,当Opus 4.7发布时,团队中多名工程师拒绝升级,原因仅仅是新版本不支持快速模式。这是SemiAnalysis团队首次主动放弃前沿智能,转而选择更快的token生成速度。


速度溢价:开发者用钱包投票

推理市场的竞争格局正在沿着一条新的轴线重新划分。

正如英伟达CEO Jensen Huang在今年GTC大会上反复强调的,吞吐量(每GPU每秒token数)与交互性(每用户每秒token数)是推理的根本性权衡——前者服务于批量处理,后者决定用户体验。SemiAnalysis将其比喻为"公共汽车与法拉利"的选择:你可以慢速服务大量用户,也可以快速服务单个用户。


市场的偏好已通过消费行为得到验证。Opus 4.6快速模式以6倍价格换取约2.5倍的交互速度,一度成为Anthropic利润率最高的产品SKU,也是其今年ARR爆发式增长的重要驱动力。然而,SemiAnalysis与OpenRouter合作收集的数据显示,该模式近期已出现性能退化——标准Opus 4.6的交互速度稳定在约40 tps,快速模式曾超过100 tps,但近期已降至约70 tps,实际加速比从2.5倍缩水至约1.75倍。

OpenAI和Anthropic均已意识到这一需求分层,并通过快速模式、优先模式、批量定价等多种产品形态,试图覆盖整个市场并寻找利润最大化的组合点。

晶圆级芯片:一场豪赌的技术逻辑

Cerebras的核心赌注,是突破光刻机单次曝光的物理极限,将整张晶圆做成一块芯片。

其第三代产品WSE-3基于台积电N5工艺制造,在一张晶圆上集成了44GB SRAM,提供21PB/s的内存带宽——比HBM高出数千倍。这一架构的本质是:用极高的内存带宽换取极低的访存延迟,使得在小批量、低算术强度的解码场景下,WSE-3能够充分发挥其理论算力,而基于HBM的GPU在同等场景下往往处于"算力饥渴"状态。

然而,这一架构也带来了显著的计算密度代价。SemiAnalysis指出,WSE-3的稠密FP16算力实际仅为15.625 PFLOPS——这与Cerebras官方宣传的125 PFLOPS相差8倍,差距源于其采用了8:1非结构化稀疏假设,SemiAnalysis将此称为"Feldman公式",并将其与英伟达的"Jensen数学"相提并论,但认为前者走得更远。

在系统成本方面,SemiAnalysis估算每台CS-3服务器的物料成本(含KVSS CPU节点)约为45万美元,远高于其硅片本身约2万美元的台积电晶圆成本。高昂的定制化电源模块(来自Vicor)、液冷系统以及每批次晶圆所需的定制掩膜版,共同推高了整体成本结构。


架构短板:网络带宽的几何困境

WSE-3最显著的弱点,是极为有限的片外带宽。

每块WSE-3仅提供150GB/s(1.2Tb/s)的片外带宽,仅为英伟达Blackwell NVLink5单GPU 900GB/s规模扩展带宽的六分之一。这一限制并非设计疏忽,而是晶圆级架构的内在约束——SemiAnalysis将其称为"岛屿问题"。

问题的根源在于晶圆的均匀步进曝光机制。WSE-3由84个相同的曝光单元(die)拼接而成,每个曝光单元必须完全相同,以确保跨die的片上2D网格互联正常工作。这意味着无法将SerDes PHY集中部署在晶圆边缘——若要增加I/O带宽,就必须在每个曝光单元中都预留PHY面积,而位于晶圆内部的PHY无法连接外部,形成大量"搁浅硅"。此外,PHY模块还会在片上网格中形成"空洞",增加数据路由延迟,削弱晶圆级架构的核心优势。

这一带宽瓶颈直接限制了Cerebras服务大模型的能力。对于参数量超过1万亿、上下文窗口达到百万token级别的现代智能体工作负载,Cerebras不得不采用流水线并行策略,将模型按层切分到多块晶圆上,仅在晶圆间传输激活值。但随着模型规模扩大,所需晶圆数量线性增加,每次晶圆间传输的固定延迟也随之累积,最终侵蚀速度优势。

SRAM扩展已死:路线图的隐忧

Cerebras面临的另一个结构性挑战,是SRAM密度扩展的物理极限。

从WSE-1(台积电16nm,18GB SRAM)到WSE-2(7nm,40GB),SRAM容量实现了2.2倍的代际提升。但WSE-3从7nm升级至5nm,SRAM容量仅从40GB增至44GB,增幅仅10%,而逻辑晶体管数量增长了约50%。SemiAnalysis的数据显示,在5nm之后,台积电N3E相对N5的SRAM单元面积几乎没有缩减,N2及后续节点亦然——SRAM扩展实际上已经停滞。


这意味着Cerebras未来提升SRAM容量的唯一路径,是在固定晶圆面积内牺牲计算面积换取存储面积,形成严格的零和权衡。下一代CS-4系统将沿用基于N5的WSE-3,仅通过提升功耗来提高时钟频率和算力,SRAM容量维持不变。

相比之下,英伟达收购Groq后,可通过混合键合技术在Z轴方向叠加SRAM芯片(即LP40路线图),绕开平面扩展的限制。Cerebras也在探索类似路径——将DRAM晶圆或光子互联晶圆通过混合键合叠加在WSE上,但SemiAnalysis对其技术可行性和时间表持审慎态度,认为晶圆级混合键合面临的热机械应力和键合波挑战远比常规芯片复杂。

OpenAI交易:单一客户的双刃剑

Cerebras与OpenAI的关系,已远超普通供应商与客户的范畴。

根据SemiAnalysis援引的S-1文件,双方于2025年12月签署主关系协议(MRA),OpenAI承诺在2026至2028年间分批采购750兆瓦AI推理算力,每批次合同期3至4年,可延长至5年,并持有额外采购1.25吉瓦的选择权。截至2025年12月31日,Cerebras剩余履约义务达246亿美元。


资本结构上,OpenAI同时扮演三重角色:向Cerebras提供10亿美元有担保营运资金贷款(年利率6%,若以算力交付方式偿还则豁免利息);持有3344.5万股N类(无投票权)普通股认股权证,行权价格接近于零;并在完全稀释基础上可能持有Cerebras约12%的股份。若MRA因OpenAI以外的原因终止,Cerebras须立即偿还全部贷款余额及应计利息,且OpenAI有权直接控制托管账户资金的使用。

这一结构意味着Cerebras的增长前景与单一客户高度绑定。SemiAnalysis预计,Cerebras未来数年收入将出现明显拐点,OpenAI是主要增长驱动力,但执行风险同样集中——在2028年前,Cerebras需要交付的服务器数量将比其历史累计出货量高出一个数量级,而数据中心容量的落地进度是最大的不确定性。

速度换智能:这笔交易值多少钱

OpenAI在Cerebras上运行的旗舰产品GPT-5.3-Codex-Spark,并非真正的GPT-5.3-Codex,而是基于gpt-oss-120B架构、经GPT-5.3-Codex蒸馏训练的小型模型,参数量比原版小逾10倍。

SemiAnalysis对此直言不讳:Cerebras的芯片在经济上目前只能高效服务相对较小的模型。对于参数量超过1万亿、上下文窗口达到100万token的现代智能体工作负载,OpenAI若要在Cerebras上运行,需要接受显著的成本溢价,且预计实际交互速度将低于每秒1000个token。

然而,这一判断背后存在一个关键变量:算法进步的速度。SemiAnalysis认为,距离120B参数模型达到GPT-5.5级别的智能,可能不到一年时间。届时,"以前沿智能换极速token"的价值主张将发生质变——正如今天工程师们宁愿放弃Opus 4.7的更高智能,也要坚守Opus 4.6快速模式的交互体验。

750兆瓦的初始承诺已经锁定。真正的问题是:当120B模型的智能追上今天的前沿水平,OpenAI是否会选择将选择权转化为实际采购,将协议规模扩展至2吉瓦乃至更多。这一答案,将决定Cerebras的IPO估值能否兑现,也将定义下一阶段推理战争的胜负手。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
王楚钦为何难当国乒核心重任?

王楚钦为何难当国乒核心重任?

风铃草语
2026-10-03 07:12:28
为什么说中国汽车正改写全球经济秩序?

为什么说中国汽车正改写全球经济秩序?

风铃草语
2026-10-03 07:15:55
97亿爆雷、女婿入狱、家族退出:刘长乐的凤凰三十年

97亿爆雷、女婿入狱、家族退出:刘长乐的凤凰三十年

小椰的奶奶
2026-10-02 18:32:19
刚拿冠军就退役,当晚直接打包行李走人,这姑娘的操作把全网看傻

刚拿冠军就退役,当晚直接打包行李走人,这姑娘的操作把全网看傻

静若梨花
2026-08-29 10:42:55
气炸了!上海一面馆贴满硬核告示,写明“谢绝本地中年妇女点单”

气炸了!上海一面馆贴满硬核告示,写明“谢绝本地中年妇女点单”

牛锅巴小钒
2026-10-01 10:47:35
《兰香如故》大结局:许兰香无意说的一句话,显现了自己的身份

《兰香如故》大结局:许兰香无意说的一句话,显现了自己的身份

天玑影视说
2026-10-02 16:20:26
3-0!德布劳内创纪录,世界波技惊四座,面对欧洲二流,轻松拿捏

3-0!德布劳内创纪录,世界波技惊四座,面对欧洲二流,轻松拿捏

汪星人哟
2026-10-03 09:04:08
富贵花的备胎上位了

富贵花的备胎上位了

毒舌扒姨太
2025-03-30 22:33:21
高级反击!斯宾塞伯爵一本书卖到脱销的那晚,凯特王妃戴上了一条103岁的项链

高级反击!斯宾塞伯爵一本书卖到脱销的那晚,凯特王妃戴上了一条103岁的项链

一杯咖啡语
2026-09-30 17:33:05
伴娘礼服颜色不一样,新娘只让闺蜜站身边,其他伴娘不干了

伴娘礼服颜色不一样,新娘只让闺蜜站身边,其他伴娘不干了

浅遇时光
2026-10-02 05:45:08
意外!76%葡萄牙民众不满C罗 总裁大姐连发7动态发声:天道好轮回

意外!76%葡萄牙民众不满C罗 总裁大姐连发7动态发声:天道好轮回

风过乡
2026-10-02 11:40:53
第一集就很劲爆,HBO这部新剧可以看了

第一集就很劲爆,HBO这部新剧可以看了

来看美剧
2026-10-02 20:56:29
当着美国政客的面,苏杰生直言:中印再斗,只会便宜第三方

当着美国政客的面,苏杰生直言:中印再斗,只会便宜第三方

像梦一场a
2026-10-02 16:17:52
合村并居,势在必行?

合村并居,势在必行?

城事堂
2026-10-02 17:28:37
太硬气了!中国男排死磕亚洲霸主日本,五局血战冲击亚运决赛

太硬气了!中国男排死磕亚洲霸主日本,五局血战冲击亚运决赛

宝哥精彩赛事
2026-10-03 02:13:14
奉贤一辆雷克萨斯被举报:车牌缺胳膊少腿

奉贤一辆雷克萨斯被举报:车牌缺胳膊少腿

上观新闻
2026-10-02 17:28:30
从水晶宫加盟时身价5500万欧,奥利塞身价两年暴涨至1.8亿欧

从水晶宫加盟时身价5500万欧,奥利塞身价两年暴涨至1.8亿欧

懂球帝
2026-10-02 19:46:12
油价暴跌,美科技股强劲反弹

油价暴跌,美科技股强劲反弹

证券时报
2026-10-02 23:22:35
上线两天,巫师3重制版冒出450款Mod

上线两天,巫师3重制版冒出450款Mod

渡川5
2026-10-02 05:32:49
不查不知道一查吓一跳!44岁一家人住北京豪宅的陈婷,私下有多壕

不查不知道一查吓一跳!44岁一家人住北京豪宅的陈婷,私下有多壕

冷紫葉
2026-09-19 12:41:16
2026-10-03 09:40:49
华尔街见闻官方 incentive-icons
华尔街见闻官方
中国领先的金融商业信息提供商
153034文章数 2654903关注度
往期回顾 全部

科技要闻

英伟达盘中创历史新高,市值逼近6万亿美元

头条要闻

小区12楼马桶倒灌溯源无果 业主把楼上6户全告上法院

头条要闻

小区12楼马桶倒灌溯源无果 业主把楼上6户全告上法院

体育要闻

30天30队·快船:被莱纳德挂在半空的未来?

娱乐要闻

包贝尔国庆露营被拍 酒店风波后首现身

财经要闻

4亿台电视挂墙落灰 为何没人愿意开了?

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

家居
教育
健康
亲子
本地

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

老师只能陪孩子走一程,父母才是永不退休的班主任(老师转给家长)

刷酸祛痘,为什么有人翻车?

亲子要闻

这是压了多少年啊

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

无障碍浏览 进入关怀版