来源:市场资讯
(来源:边小缘 边缘计算社区)
深夜十一点,一家亚太情感陪伴 App 的后台数据还在往上跳。
日活又破了新高,运营团队在群里发庆祝的表情包,CFO 在另一个群里沉默地看着账单。
用户越多,本该越赚钱。可这家公司的真实处境是,用户涨得越快,亏得越狠。
语音要实时合成,图片和视频要多模态生成,用户和虚拟角色的对话二十四小时不打烊。每一次开口,背后都是一次模型调用、一次数据传输、一笔真金白银的开销。增长曲线越陡,亏损贴得越紧。
![]()
撞过这面墙的出海 AI 团队不少。
产品测试期,账单还能忍。用户规模一起来,推理成本就像开了闸。有人怀疑模型选错了,有人砍功能省钱,却很少有人继续往下追问:问题会不会出在更底层,出在真正跑推理的 GPU,以及围绕它的一整套基础设施上?
后来,这家公司把推理迁到了 Akamai 的 AI 推理云。GPU 换型号,精度换方案,流量成本重新算了一遍。半年后回头看,整体 AI 与 IT 成本砍掉了大约六成,项目从亏损变成了盈利。
同一个模型,同一批用户,账单为什么能差出这么多?
很多时候,这本账的第一处差距,就从 GPU 选型开始。选错一张卡,后面的显存、并发、流量和架构成本,都可能被一起放大。
01
选 H100,可能从一开始就选错了
去问正在做 AI 出海的团队,跑推理用什么卡?
很多人的第一反应会是 H100。
这几乎变成一种惯性:沾了 AI,不上顶配,好像还没开跑就输了。
问题是,训练和推理本来就是两类不同的任务。
训练更看重多卡互联、显存容量和大规模计算能力;到了推理阶段,真正影响成本的,是单张卡能不能装下完整模型、有限显存里能扛多少并发,以及每一个 token 到底要花多少钱。
拿训练时代的顶级卡直接套到所有推理场景里,有点像开越野车挤城市早高峰。车当然是好车,但未必最经济。
差距往往藏在一个容易忽略的细节里:精度。
2026 年 3 月,Akamai 把 NVIDIA RTX PRO 6000 部署到自己的全球节点。这张卡原生支持 FP4,而 H100 所在的 Hopper 架构主要支持到 FP8。
![]()
精度从 FP8 往 FP4 降,最直接的变化是模型占用显存减少。对于不少推理模型来说,在可接受的精度损失下,省下来的显存可以承载更多并发、更长上下文,甚至让原本需要多卡的模型压进单卡。
数字更直观。
Akamai 公布的 Benchmark 显示,其部署的 RTX PRO 6000 推理吞吐最高可做到 H100 的 1.63 倍。跑 Llama 3.3 70B 时,每百万 token 成本约 0.31 美元,比 H100 低约 14%。
时租上,Akamai 大部分数据中心节点的 RTX PRO 6000 为 3 美元/小时起,部分主流云厂商的同款 GPU 价格则在 5 美元/小时以上。
对一项每天跑二十四小时的推理服务来说,每小时几美元的差距,乘上几十张、上百张卡和整个月的利用率,很快就会变成一笔不小的成本。
真正需要问的问题因此不是:哪张卡最强?
而是哪张卡每一美元能产出最多有效推理?
02
便宜的卡,不一定带来更便宜的推理
顺着省钱往下想,很多团队会冒出一个自然的念头:既然企业级 GPU 贵,直接上消费级游戏卡行不行?
比如 RTX 5090。
创业初期拿它跑 Demo、做内部测试,没有问题。可一旦进入稳定运营阶段,事情就不只是比较一张卡多少钱了。
![]()
首先是显存。消费级卡能够支撑不少中小模型,但面对更大的模型、更长上下文和更高并发时,显存很快会成为瓶颈。
其次是稳定性和扩展能力。单机测试跑得起来,不等于多卡、长时间、高负载环境下依然适合生产。用户规模上来之后,架构重构、故障排查和工程维护本身都会变成成本。
这也是为什么企业推理选卡,不能只盯采购价或者小时租金。
Akamai 部署的 RTX PRO 6000 提供 96GB GDDR7 显存。对于 30B 到 70B 级别的推理模型,量化之后有机会直接在单卡中运行,并留下更多空间给上下文和并发。
它解决的不是“怎样买到一张更便宜的卡”,而是:
怎样用更少的卡,把同样的业务稳定跑起来。
03
流量费这本账,比算力更容易被忽略
但选对卡,只是把这本账算对了一半。
还有一笔支出尤其容易被忽视:出站流量费,也就是 egress。
对于纯文本模型,这笔钱未必显眼。但到了语音、图片和视频生成场景,一次请求传出去的数据量可能迅速增加。
用户越活跃,生成内容越丰富,数据传输就越频繁。
这时候,GPU 并不是唯一一台不停转动的计价器。
不少主流云平台的公网出站流量价格大约在每 GB 0.08 到 0.10 美元,Akamai 的相关价格可以低到每 GB 0.005 美元。
两者之间不是几个百分点的差异,而可能是一个数量级以上。
对多模态 AI 产品而言,这一点尤其重要。一段实时语音、一批生成图片、一条短视频,单次传输看起来都不夸张,但乘上几十万甚至几百万用户之后,网络成本很容易从账单里的小项,变成不能忽略的固定支出。
Akamai 能把这部分价格压下来,与它近三十年积累的 CDN 和边缘网络基础设施有关。
过去,它把网页、图片和视频送到全球用户手里;今天,换成把模型生成的回答、语音和画面送出去。内容变了,底层仍然有很大一部分是同一本网络账。
所以,AI 推理的成本不能只算:
GPU 一小时多少钱。
更完整的公式应该是:
GPU + 网络 + 并发效率 + 利用率 + 运维成本。
04
推理节点离用户多远,也会写进成本里
除了钱,还有另一个容易被低估的变量:延迟。
用户并不关心后端用了什么模型,也不关心跑在什么 GPU 上。
用户只知道一件事:
我问完以后,它多久开始回答。
首个 token 慢上几秒,聊天的流畅感就会明显下降;到了实时语音、在线客服、AI NPC 这类场景,几百毫秒的差异都可能被感知。
要降低延迟,一个最直接的方法,就是让推理尽可能靠近用户。
Akamai 已经把 RTX PRO 6000 部署到全球多个数据中心节点,覆盖新加坡、东京、孟买、雅加达、法兰克福、洛杉矶等城市。
![]()
对于一款服务全球用户的 AI 应用,这意味着请求不必默认跨越半个地球,集中进入少数几个核心区域,再把结果原路传回来。
物理距离是一部分,网络路径则是另一部分。
一次内部测试中,同样从美国节点为南美西语用户提供服务,切换到 Akamai 网络的对应路径后,延迟缩短了约 15%。
服务器和用户的地理坐标都没变,变化的是数据在互联网上实际走过的那条路。
算力决定模型多久算完,网络决定结果多久真正到达用户。
对全球化 AI 产品来说,这两部分最终共同决定用户感受到的速度。
05
三本真实账
技术原理讲得再多,最终还是要落回具体业务。
下面三个案例来自 Akamai 的实际客户实践,并按客户要求进行了匿名处理。
账本一:情感陪伴 App
文章开头那家亚太情感陪伴企业,原先使用较老一代的旗舰训练卡承担多模态语音交互。
算上 GPU 和较高的出站流量成本之后,每生成一百万 token 的综合成本一度接近 4.5 到 5 美元。
迁移到 Akamai 后,团队换用 RTX PRO 6000,并采用 FP4 方案,同时降低网络传输成本。最终,每百万 token 的综合成本降到约 1.8 美元,整体 AI 与 IT 开销下降约六成,项目也从亏损转向盈利。
这个案例真正改变的,不只是 GPU,而是把模型精度、算力和网络放回同一张成本表里重新计算。
账本二:韩国头部游戏公司
另一家韩国头部游戏公司,在一款全球运营的实时在线游戏里同时运行两个 AI 场景。
游戏内 NPC 的实时对话,背后是一个 70B 大模型,对响应速度和显存要求都很高,因此跑在 RTX PRO 6000 上。
而离线生成游戏素材的文生图任务,模型更小,对实时响应要求也更低,于是使用上一代 RTX 4000 Ada。
一个实时任务用高端 GPU,一个离线任务用更经济的 GPU。
这里的原则很简单:
不是所有 AI 任务,都值得上最贵的卡。
账本三:家庭安防摄像头
第三家客户是一家全球家庭安防摄像头企业。
做 AI 异常入侵检测时,它没有把整条视频处理链路全部堆给 GPU,而是先拆工作流。
大量原始视频先经过专用视频处理芯片 VPU 完成抽帧和初步筛选,只有真正包含异常信息的关键帧,才继续送进 GPU 做精细识别。
相比传统的纯 CPU + GPU 方案,VPU + GPU 的混合架构节省了约 30% 到 60% 的成本。
这又把问题往前推进了一步:
前两个案例问的是,该选哪张 GPU。
这个案例问的是,哪些工作根本不需要交给 GPU。
推理的性价比,很多时候不是把一张卡跑得更满,而是先把工作流拆开,每一段任务交给最适合它的硬件。
06
卖 CDN 和卖智能,算的是同一本账
出海企业今天算 AI 推理这笔账,和很多年前算 CDN 流量账,本质上没有那么不同。过去,是把网页和视频更快、更便宜地送到全球用户眼前;今天,换成了模型生成的回答、语音和画面。
技术对象变了,底层还是同一本账。
所以,真正的推理成本从来不只是“GPU 一小时多少钱”。显存、并发、流量、网络路径,以及不同任务该用什么硬件,最后都会写进同一张账单。
用户规模小时,这些差异并不起眼;到了几十万、几百万用户,每一次不起眼的资源浪费都会被成倍放大。
这时候,基础设施优化就不再只是工程问题,而是一道商业模式题。
一张 GPU 卡的选择,可能就是这本账开始分叉的地方。
选错了,用户越多,成本放大得越快;选对了,再把网络和工作流一起算进去,增长才更有机会变成利润。
单个 token 的价格还会继续下降,但一家 AI 公司最终是赚钱还是烧钱,取决于有没有把整本推理账算对。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.