网易首页 > 网易号 > 正文 申请入驻

一张GPU卡,可能决定了出海AI是赚钱还是烧钱

0
分享至

来源:市场资讯

(来源:边小缘 边缘计算社区)

深夜十一点,一家亚太情感陪伴 App 的后台数据还在往上跳。

日活又破了新高,运营团队在群里发庆祝的表情包,CFO 在另一个群里沉默地看着账单。

用户越多,本该越赚钱。可这家公司的真实处境是,用户涨得越快,亏得越狠。

语音要实时合成,图片和视频要多模态生成,用户和虚拟角色的对话二十四小时不打烊。每一次开口,背后都是一次模型调用、一次数据传输、一笔真金白银的开销。增长曲线越陡,亏损贴得越紧。


撞过这面墙的出海 AI 团队不少。

产品测试期,账单还能忍。用户规模一起来,推理成本就像开了闸。有人怀疑模型选错了,有人砍功能省钱,却很少有人继续往下追问:问题会不会出在更底层,出在真正跑推理的 GPU,以及围绕它的一整套基础设施上?

后来,这家公司把推理迁到了 Akamai 的 AI 推理云。GPU 换型号,精度换方案,流量成本重新算了一遍。半年后回头看,整体 AI 与 IT 成本砍掉了大约六成,项目从亏损变成了盈利。

同一个模型,同一批用户,账单为什么能差出这么多?

很多时候,这本账的第一处差距,就从 GPU 选型开始。选错一张卡,后面的显存、并发、流量和架构成本,都可能被一起放大。

01

选 H100,可能从一开始就选错了

去问正在做 AI 出海的团队,跑推理用什么卡?

很多人的第一反应会是 H100。

这几乎变成一种惯性:沾了 AI,不上顶配,好像还没开跑就输了。

问题是,训练和推理本来就是两类不同的任务。

训练更看重多卡互联、显存容量和大规模计算能力;到了推理阶段,真正影响成本的,是单张卡能不能装下完整模型、有限显存里能扛多少并发,以及每一个 token 到底要花多少钱。

拿训练时代的顶级卡直接套到所有推理场景里,有点像开越野车挤城市早高峰。车当然是好车,但未必最经济。

差距往往藏在一个容易忽略的细节里:精度。

2026 年 3 月,Akamai 把 NVIDIA RTX PRO 6000 部署到自己的全球节点。这张卡原生支持 FP4,而 H100 所在的 Hopper 架构主要支持到 FP8。


精度从 FP8 往 FP4 降,最直接的变化是模型占用显存减少。对于不少推理模型来说,在可接受的精度损失下,省下来的显存可以承载更多并发、更长上下文,甚至让原本需要多卡的模型压进单卡。

数字更直观。

Akamai 公布的 Benchmark 显示,其部署的 RTX PRO 6000 推理吞吐最高可做到 H100 的 1.63 倍。跑 Llama 3.3 70B 时,每百万 token 成本约 0.31 美元,比 H100 低约 14%。

时租上,Akamai 大部分数据中心节点的 RTX PRO 6000 为 3 美元/小时起,部分主流云厂商的同款 GPU 价格则在 5 美元/小时以上。

对一项每天跑二十四小时的推理服务来说,每小时几美元的差距,乘上几十张、上百张卡和整个月的利用率,很快就会变成一笔不小的成本。

真正需要问的问题因此不是:哪张卡最强?

而是哪张卡每一美元能产出最多有效推理?

02

便宜的卡,不一定带来更便宜的推理

顺着省钱往下想,很多团队会冒出一个自然的念头:既然企业级 GPU 贵,直接上消费级游戏卡行不行?

比如 RTX 5090。

创业初期拿它跑 Demo、做内部测试,没有问题。可一旦进入稳定运营阶段,事情就不只是比较一张卡多少钱了。


首先是显存。消费级卡能够支撑不少中小模型,但面对更大的模型、更长上下文和更高并发时,显存很快会成为瓶颈。

其次是稳定性和扩展能力。单机测试跑得起来,不等于多卡、长时间、高负载环境下依然适合生产。用户规模上来之后,架构重构、故障排查和工程维护本身都会变成成本。

这也是为什么企业推理选卡,不能只盯采购价或者小时租金。

Akamai 部署的 RTX PRO 6000 提供 96GB GDDR7 显存。对于 30B 到 70B 级别的推理模型,量化之后有机会直接在单卡中运行,并留下更多空间给上下文和并发。

它解决的不是“怎样买到一张更便宜的卡”,而是:

怎样用更少的卡,把同样的业务稳定跑起来。

03

流量费这本账,比算力更容易被忽略

但选对卡,只是把这本账算对了一半。

还有一笔支出尤其容易被忽视:出站流量费,也就是 egress。

对于纯文本模型,这笔钱未必显眼。但到了语音、图片和视频生成场景,一次请求传出去的数据量可能迅速增加。

用户越活跃,生成内容越丰富,数据传输就越频繁。

这时候,GPU 并不是唯一一台不停转动的计价器。

不少主流云平台的公网出站流量价格大约在每 GB 0.08 到 0.10 美元,Akamai 的相关价格可以低到每 GB 0.005 美元。

两者之间不是几个百分点的差异,而可能是一个数量级以上。

对多模态 AI 产品而言,这一点尤其重要。一段实时语音、一批生成图片、一条短视频,单次传输看起来都不夸张,但乘上几十万甚至几百万用户之后,网络成本很容易从账单里的小项,变成不能忽略的固定支出。

Akamai 能把这部分价格压下来,与它近三十年积累的 CDN 和边缘网络基础设施有关。

过去,它把网页、图片和视频送到全球用户手里;今天,换成把模型生成的回答、语音和画面送出去。内容变了,底层仍然有很大一部分是同一本网络账。

所以,AI 推理的成本不能只算:

GPU 一小时多少钱。

更完整的公式应该是:

GPU + 网络 + 并发效率 + 利用率 + 运维成本。

04

推理节点离用户多远,也会写进成本里

除了钱,还有另一个容易被低估的变量:延迟。

用户并不关心后端用了什么模型,也不关心跑在什么 GPU 上。

用户只知道一件事:

我问完以后,它多久开始回答。

首个 token 慢上几秒,聊天的流畅感就会明显下降;到了实时语音、在线客服、AI NPC 这类场景,几百毫秒的差异都可能被感知。

要降低延迟,一个最直接的方法,就是让推理尽可能靠近用户。

Akamai 已经把 RTX PRO 6000 部署到全球多个数据中心节点,覆盖新加坡、东京、孟买、雅加达、法兰克福、洛杉矶等城市。


对于一款服务全球用户的 AI 应用,这意味着请求不必默认跨越半个地球,集中进入少数几个核心区域,再把结果原路传回来。

物理距离是一部分,网络路径则是另一部分。

一次内部测试中,同样从美国节点为南美西语用户提供服务,切换到 Akamai 网络的对应路径后,延迟缩短了约 15%。

服务器和用户的地理坐标都没变,变化的是数据在互联网上实际走过的那条路。

算力决定模型多久算完,网络决定结果多久真正到达用户。

对全球化 AI 产品来说,这两部分最终共同决定用户感受到的速度。

05

三本真实账

技术原理讲得再多,最终还是要落回具体业务。

下面三个案例来自 Akamai 的实际客户实践,并按客户要求进行了匿名处理。

账本一:情感陪伴 App

文章开头那家亚太情感陪伴企业,原先使用较老一代的旗舰训练卡承担多模态语音交互。

算上 GPU 和较高的出站流量成本之后,每生成一百万 token 的综合成本一度接近 4.5 到 5 美元。

迁移到 Akamai 后,团队换用 RTX PRO 6000,并采用 FP4 方案,同时降低网络传输成本。最终,每百万 token 的综合成本降到约 1.8 美元,整体 AI 与 IT 开销下降约六成,项目也从亏损转向盈利。

这个案例真正改变的,不只是 GPU,而是把模型精度、算力和网络放回同一张成本表里重新计算。

账本二:韩国头部游戏公司

另一家韩国头部游戏公司,在一款全球运营的实时在线游戏里同时运行两个 AI 场景。

游戏内 NPC 的实时对话,背后是一个 70B 大模型,对响应速度和显存要求都很高,因此跑在 RTX PRO 6000 上。

而离线生成游戏素材的文生图任务,模型更小,对实时响应要求也更低,于是使用上一代 RTX 4000 Ada。

一个实时任务用高端 GPU,一个离线任务用更经济的 GPU。

这里的原则很简单:

不是所有 AI 任务,都值得上最贵的卡。

账本三:家庭安防摄像头

第三家客户是一家全球家庭安防摄像头企业。

做 AI 异常入侵检测时,它没有把整条视频处理链路全部堆给 GPU,而是先拆工作流。

大量原始视频先经过专用视频处理芯片 VPU 完成抽帧和初步筛选,只有真正包含异常信息的关键帧,才继续送进 GPU 做精细识别。

相比传统的纯 CPU + GPU 方案,VPU + GPU 的混合架构节省了约 30% 到 60% 的成本。

这又把问题往前推进了一步:

前两个案例问的是,该选哪张 GPU。

这个案例问的是,哪些工作根本不需要交给 GPU。

推理的性价比,很多时候不是把一张卡跑得更满,而是先把工作流拆开,每一段任务交给最适合它的硬件。

06

卖 CDN 和卖智能,算的是同一本账

出海企业今天算 AI 推理这笔账,和很多年前算 CDN 流量账,本质上没有那么不同。过去,是把网页和视频更快、更便宜地送到全球用户眼前;今天,换成了模型生成的回答、语音和画面。

技术对象变了,底层还是同一本账。

所以,真正的推理成本从来不只是“GPU 一小时多少钱”。显存、并发、流量、网络路径,以及不同任务该用什么硬件,最后都会写进同一张账单。

用户规模小时,这些差异并不起眼;到了几十万、几百万用户,每一次不起眼的资源浪费都会被成倍放大。

这时候,基础设施优化就不再只是工程问题,而是一道商业模式题。

一张 GPU 卡的选择,可能就是这本账开始分叉的地方。

选错了,用户越多,成本放大得越快;选对了,再把网络和工作流一起算进去,增长才更有机会变成利润。

单个 token 的价格还会继续下降,但一家 AI 公司最终是赚钱还是烧钱,取决于有没有把整本推理账算对。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
刚刚!第18号台风增强!江苏大雨、中雨

刚刚!第18号台风增强!江苏大雨、中雨

无锡eTV全媒体
2026-08-23 03:01:13
中国桥梁看江苏!总投资444亿,江苏又来一个超级工程!

中国桥梁看江苏!总投资444亿,江苏又来一个超级工程!

天气观察站
2026-08-23 01:05:14
江苏富豪重金为痴傻儿子娶妻,拜金女孩欣然答应,新婚当晚却愣住

江苏富豪重金为痴傻儿子娶妻,拜金女孩欣然答应,新婚当晚却愣住

温情邮局
2025-07-09 14:39:26
上任以来,特朗普最大贡献就是:亲手促成了中国人对美国的祛魅

上任以来,特朗普最大贡献就是:亲手促成了中国人对美国的祛魅

军机Nova
2026-08-22 00:20:07
大捷!俄罗斯宣布重大战果,乌克兰“王牌”被废?美欧都得去学习

大捷!俄罗斯宣布重大战果,乌克兰“王牌”被废?美欧都得去学习

共工之锚
2026-08-22 00:17:23
我妈出轨20年,我爸忍耐了20年,我妈50岁生日时我才知道他有多狠

我妈出轨20年,我爸忍耐了20年,我妈50岁生日时我才知道他有多狠

千秋文化
2026-08-12 20:13:55
邓亚萍点名孙颖莎,说的何止是戴首饰

邓亚萍点名孙颖莎,说的何止是戴首饰

阿废冷眼观察所
2026-08-22 16:34:59
郑智神了:率队掀翻山东泰山,中超大黑马诞生:升到第3名

郑智神了:率队掀翻山东泰山,中超大黑马诞生:升到第3名

足球狗说
2026-08-22 22:03:37
浙江如是书院被关停,有学员天天做梦被殴打,确诊重度抑郁,亲历者:1年学费12万,最小学员仅8岁;有家长称课程对做人帮助很大

浙江如是书院被关停,有学员天天做梦被殴打,确诊重度抑郁,亲历者:1年学费12万,最小学员仅8岁;有家长称课程对做人帮助很大

大风新闻
2026-08-22 11:08:04
李小冉喜提奔驰大G

李小冉喜提奔驰大G

小椰的奶奶
2026-08-22 05:46:25
禁止全部中方外交官入境,不准两岸统一,这国家比美国还要嚣张?

禁止全部中方外交官入境,不准两岸统一,这国家比美国还要嚣张?

青杍无梦
2026-08-22 07:10:11
佟大为与关悦在辽宁大孤山过七夕节,47岁的关悦看着老了不少

佟大为与关悦在辽宁大孤山过七夕节,47岁的关悦看着老了不少

可乐谈情感
2026-08-23 03:26:07
华为Mate90 Pro重磅爆料,Mate80 Pro直降1500元

华为Mate90 Pro重磅爆料,Mate80 Pro直降1500元

小柱解说游戏
2026-08-23 05:04:00
1980年,谢贤和狄波拉在街头被抓拍的一张照片!此时她身怀六甲,腹中孩子便是谢霆锋。

1980年,谢贤和狄波拉在街头被抓拍的一张照片!此时她身怀六甲,腹中孩子便是谢霆锋。

LULU生活家
2026-08-21 20:10:43
西方最怕的逻辑来了:马来西亚总理用美国宪法,给中国统一正名!

西方最怕的逻辑来了:马来西亚总理用美国宪法,给中国统一正名!

刘振起观点
2026-08-22 09:36:05
哈里梅根人还没到英国,王室用一张全家福回应:团圆?没这个剧本

哈里梅根人还没到英国,王室用一张全家福回应:团圆?没这个剧本

动物奇奇怪怪
2026-08-22 18:27:15
紧急预警!超强台风沙德尔直扑东海,江浙沪直面硬刚,风雨大降温要来了

紧急预警!超强台风沙德尔直扑东海,江浙沪直面硬刚,风雨大降温要来了

糖逗在娱乐
2026-08-23 04:38:51
电影院推出“躺平午休服务” 睡2.5小时只要1元多

电影院推出“躺平午休服务” 睡2.5小时只要1元多

闪电新闻
2026-08-21 18:21:08
真正破防!国乒最干净的情谊!林诗栋至死不渝的偏爱,体坛太少见

真正破防!国乒最干净的情谊!林诗栋至死不渝的偏爱,体坛太少见

寒律
2026-08-22 17:33:50
10万亿“世界铜王”也崩了?,比恒大更荒诞的,是一个PPT堆出的帝国

10万亿“世界铜王”也崩了?,比恒大更荒诞的,是一个PPT堆出的帝国

聚焦真实瞬间
2026-08-21 11:49:55
2026-08-23 06:48:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4514264文章数 9344关注度
往期回顾 全部

科技要闻

苹果裁员200人:Vision Pro砍游戏团队

头条要闻

全季起诉“金季”索赔10万 老板娘:日租才50到60元

头条要闻

全季起诉“金季”索赔10万 老板娘:日租才50到60元

体育要闻

字母+汤神,有没有搞头?

娱乐要闻

《空枪》预测票房缩水,手握王炸都没赢

财经要闻

蔡昉解读经济:扩大消费需求的政策思考

汽车要闻

钛9全球首秀/四季度上市 方程S系列内饰车展亮相

态度原创

房产
手机
本地
艺术
军事航空

房产要闻

两大热盘即将入市!三亚又一批安居房狠货要炸场了!

手机要闻

小米18 Pro透明探索版回归:致敬一代经典小米8

本地新闻

《牛来》的一声“妈妈”,到底多少人被精神污染了

艺术要闻

60年里的惊人照片,记忆的定格!

军事要闻

披露林肯号航母内幕的美国军报多人被炒

无障碍浏览 进入关怀版