网易首页 > 网易号 > 正文 申请入驻

英伟达 Blackwell 架构与开源协同,推动 AI 推理成本降低 10 倍

0
分享至


AI 行业的花钱、省钱逻辑正迎来大变化。

以往用昂贵专有模型的高成本模式正在被颠覆,低成本、高性价比的开源模型 + 专用软硬件的组合有望成为主流。

英伟达日前发布全面分析,显示其最新的 Blackwell GPU 平台与开源推理模型的组合可使每 token 成本降低 4 到 10 倍。

该数据于 2026 年 2 月 13 日发布,强调行业正从昂贵的专有模型转向由开源智能与专用硬件-软件协同设计驱动的、更具成本效益且高性能的生态系统。这些成本降低是通过多层方法实现的,涵盖 Blackwell GPU 架构、原生低精度 NVFP4 数据格式,以及包括 TensorRT-LLM 和 Dynamo 推理框架在内的优化软件库。

英伟达表示,这些技术进步使得 Baseten、DeepInfra、Fireworks AI 和 Together AI 等推理服务提供商能够以远低于以往的成本提供前沿级智能。

例如,采用 NVFP4 格式时,每百万 token 的成本从旧的 Hopper 平台上的 20 美分降至 Blackwell 上的仅 5 美分——单就硬件成本而言就下降了 75%,还未计算切换到开源模型带来的额外节省。

这一变化的现实影响已在多个高需求领域显现。

在医疗领域,AI 初创公司 Sully.ai 报告称,通过将业务从专有闭源模型迁移到由 Baseten 托管、基于 Blackwell 的开源替代方案,推理成本下降了 90%。这一 10 倍的成本降低伴随着 65% 的响应时间提升,使公司能更高效地自动化医疗编码与文档工作。

同样在游戏领域,开发商 Latitude 利用 DeepInfra 的 Blackwell 基础设施为其原生 AI 游戏 Voyage 保持低延迟响应的同时,将 token 成本降低了 4 倍。这使得在流量高峰期间也能部署更复杂的模型而不影响玩家体验。

从分析角度看,这一进展标志着许多企业 AI 应用的“专有溢价”时代的终结。

在过去两年中,闭源模型的高成本成为许多初创公司进入的障碍。然而,随着开源模型与前沿专有系统达成性能上的可比,瓶颈已从模型智能转向基础设施效率

英伟达的“极致协同设计”战略——将硬件(Blackwell)、数据格式(NVFP4)和软件(TensorRT)同步开发——正在打造一道竞争护城河,使得使用通用硬件的云服务提供商难以在每 token 成本上竞争。

这种 10 倍的成本降低对所谓的“代理式”工作流尤为关键,在此类场景中,单个用户查询可能触发数十个后台自主交互。开发开源推理系统的 Sentient Labs 报告称,在病毒式发布期间,使用基于 Blackwell 的 Fireworks AI 提供了处理单周 560 万次查询所需的吞吐量。

若无这些效率提升,多代理系统的基础设施开销对大多数开发者而言在经济上无法支撑。此外,在客户服务方面,Decagon 在语音 AI 上实现了低于 400 毫秒的响应时间,与专有模型相比,每次查询成本降低了 6 倍。这种性能水平对 24/7 的语音部署至关重要,因为延迟直接影响用户信任。

展望未来,token 成本下降的趋势预计将加速。

英伟达的路线图显示,即将推出的 Rubin 平台将目标是在 Blackwell 基础上再实现 性能与成本效率 10 倍的提升

随着 token 经济学的持续改善,我们很可能看到从“把 AI 当作一个功能”向“把 AI 作为基础设施”的转变,智能成本在运营预算中将变得微不足道。

这很可能导致高频 AI 应用的激增,例如实时视频翻译和自主工业机器人等领域,这些此前因过高的推理开销而被排除在外。(本文首发钛媒体App , 作者|AGI-Signal,编辑|秦聪慧)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
一年9.9元租地种菜?厦门一网友称被租地后的隐形账单“劝退”

一年9.9元租地种菜?厦门一网友称被租地后的隐形账单“劝退”

扬子晚报
2026-02-14 07:18:25
坐3.6亿飞机,戴1000万名表,拿5000万炒股的秦奋究竟什么背景

坐3.6亿飞机,戴1000万名表,拿5000万炒股的秦奋究竟什么背景

涵豆说娱
2026-01-19 17:21:55
中药带头大哥,被美国退货了

中药带头大哥,被美国退货了

不正确
2026-02-13 15:51:18
成功了!首款升级12000mAh电池的iPhone诞生:原来苹果是故意用小电池

成功了!首款升级12000mAh电池的iPhone诞生:原来苹果是故意用小电池

快科技
2026-02-14 07:37:20
高市早苗拿俄立威后,不到24小时,普京反击,一句话堵死日本后路

高市早苗拿俄立威后,不到24小时,普京反击,一句话堵死日本后路

松林看世界
2026-02-14 08:22:40
王毅会见美国国务卿鲁比奥

王毅会见美国国务卿鲁比奥

新华社
2026-02-14 07:49:27
德国总理慕安会上喊话美国:你能力不足以独行!

德国总理慕安会上喊话美国:你能力不足以独行!

看看新闻Knews
2026-02-14 10:37:17
广西壮族自治区柳州市委原常委高贤斌被双开

广西壮族自治区柳州市委原常委高贤斌被双开

界面新闻
2026-02-14 11:02:49
刚刚,整个日本开始了走向毁灭!

刚刚,整个日本开始了走向毁灭!

一个坏土豆
2026-02-13 19:50:54
西方三毒渗透:法律、金融、经济学!悄无声息的民族收割战!

西方三毒渗透:法律、金融、经济学!悄无声息的民族收割战!

达文西看世界
2026-02-13 13:53:53
李立群回乡祭祖,曾给异母大哥3笔钱为父赎罪,今父母哥嫂都离世

李立群回乡祭祖,曾给异母大哥3笔钱为父赎罪,今父母哥嫂都离世

白面书誏
2026-02-12 12:36:21
慕尼黑安全会议:“大象”踩碎旧梦,欧洲终于不装睡了

慕尼黑安全会议:“大象”踩碎旧梦,欧洲终于不装睡了

上观新闻
2026-02-14 07:19:46
《三国杀OL》新春盛典即将开启!族荀彧领衔登场,玩法福利抢先看

《三国杀OL》新春盛典即将开启!族荀彧领衔登场,玩法福利抢先看

游漫日记
2026-02-13 16:21:27
直线跳水!特朗普关税大变天

直线跳水!特朗普关税大变天

魏家东
2026-02-13 21:54:04
OpenAI 指控 DeepSeek 通过对美模型进行“蒸馏”来训练 AI,内部备忘录披露

OpenAI 指控 DeepSeek 通过对美模型进行“蒸馏”来训练 AI,内部备忘录披露

钛媒体APP
2026-02-13 15:22:10
在日本待了5年我才敢说:很多人眼里的日本,根本不是那么回事

在日本待了5年我才敢说:很多人眼里的日本,根本不是那么回事

夜深爱杂谈
2026-02-13 21:05:31
杭州男子开1人公司靠AI月入200万:“完全不需要员工,大脑指挥AI干活”

杭州男子开1人公司靠AI月入200万:“完全不需要员工,大脑指挥AI干活”

大象新闻
2026-02-13 19:43:06
这是刘思齐最真实的样貌,这可不是演员扮演的,货真价实的照片

这是刘思齐最真实的样貌,这可不是演员扮演的,货真价实的照片

可乐谈情感
2026-02-14 00:54:24
暴跌61%,缩水154亿美元!昔日世界第一新能源车企,真卖不动了?

暴跌61%,缩水154亿美元!昔日世界第一新能源车企,真卖不动了?

百科密码
2026-02-12 15:12:02
浙江“一人公司”兴起!前大厂程序员靠AI月入200万元:“完全不需要员工”

浙江“一人公司”兴起!前大厂程序员靠AI月入200万元:“完全不需要员工”

环球网资讯
2026-02-13 20:27:07
2026-02-14 11:40:49
钛媒体APP incentive-icons
钛媒体APP
独立财经科技媒体
129610文章数 861765关注度
往期回顾 全部

科技要闻

独家探访蔡磊:答不完的卷子 死磕最后一程

头条要闻

牛弹琴:一觉醒来乌感谢中国了 希望与中国最高层接触

头条要闻

牛弹琴:一觉醒来乌感谢中国了 希望与中国最高层接触

体育要闻

一年怒亏2个亿,库里和安德玛的“孽缘”

娱乐要闻

吴克群变“吴克穷”助农,国台办点赞

财经要闻

春节抢黄金,谁赚到钱了?

汽车要闻

星光730新春促销开启 80天销量破2.6万台

态度原创

本地
房产
艺术
时尚
数码

本地新闻

下一站是嘉禾望岗,请各位乘客做好哭泣准备

房产要闻

三亚新机场,又传出新消息!

艺术要闻

石墙上的毛主席诗词引发热议,60字作品背后高人是谁?

穿上这些鞋拥抱春天

数码要闻

美光开始量产面向数据中心的固态硬盘

无障碍浏览 进入关怀版