网易首页 > 网易号 > 正文 申请入驻

自己买卡vs一直用API,多久能回本?

0
分享至

本文是“要不要自建本地推理”决策系列的收束篇,衔接此前《GPU报价怎么看》《显卡三年后不值钱》《12个本地模型实测》三篇。文中价格与产品信息查证于2026年8月21日,云厂商定价变动频繁,请以官网当日信息为准。

很多准备跑本地大模型的人,算的是这样一笔账:

一张二手RTX3090,几千块。API每个月花几十上百块。那两三年总能把显卡钱省回来吧?

这个算法不严谨的地方在于:显卡会贬值,推理本身要耗电,本地模型和云端模型不一定是同一个能力等级,API价格也在快速变化。

本文无法准确给出“3090几年回本”的现成答案,讨论一套我们自己能代入的算法——多数人只算了“卡多少钱”,没算折旧、电费、残值和运维时间,真实回本周期通常比直觉更长。

一、两边卖的不是同一个东西

API卖的是模型能力、GPU、运维和弹性资源打包后的服务。本地机器是一台固定资产。直接拿“显卡价格÷月度API账单”做除法,是把一次性固定支出和持续变动支出混在了一起。

更麻烦的是,本地能装下的模型量级,和云端顶级模型往往不对等。如果你比较的是本地一个量化过的中等模型,和云端最强旗舰模型,这就不是“买还是租”的问题,而是比较对象本身不公平。所以第一步,要先选一组能放在一起算的基准。

二、选定基准:一款新模型,两种24GB显卡

本文用Qwen3.8-27B做本地侧的对照模型。HuggingFace模型卡显示,它是27B参数模型,权重文件约55.6GB。这个体积很关键:24GB显卡不能直接跑BF16原始权重,实际部署要走量化路线,还要看上下文长度、推理框架和显存占用。

硬件侧选两档:RTX3090和RTX4090。它们都是24GB显存,官方功耗口径分别是350W和450W。3090代表“用较低成本进入24GB显存”的思路,4090代表“花更多钱换更快速度”的思路。

云端侧用DeepSeek当前API报价做对照。这里要特别提醒一句:DeepSeek过去几个月价格体系已经多次调整,5月下调过V4-Pro价格,之后又引入峰谷计费,8月17日正式上线峰谷定价,高峰时段价格较调整前上涨明显。这不是修辞,云端成本会变,本地硬件买定后基本就固定了。所以本文不把具体元/百万token数字写死,你发文或自己计算时,要去官网现查当天价格。

三、自建成本:不只是买卡那一下子

硬件投入要分两种情况算。如果你已经有一台能用的电脑,只缺一张显卡,那只计算新增显卡成本。如果是专门为跑模型攒一台新机器,就必须把主板、内存、电源、散热和机箱都算进去。网上很多“3090跑本地模型只要几千块”的说法,算的往往只是显卡,不是一台真正能工作的机器。

折旧部分,用一个简单公式:

硬件消耗成本 = 买入价 − N年后能卖出的残值

这里有个容易踩的坑:不要同时“扣残值”又“再单独算折旧率”。两者是同一件事的两种算法,只能选一个,否则会重复扣钱。

电费部分,本文按显卡官方功耗做理论估算,没有做插座端实测:

电费 = 显卡功耗(千瓦)× 每日运行小时 × 电价 × 天数

这个估算有局限。真实使用中,CPU、主板、内存、风扇这些外围设备也会耗电;同时GPU推理时很少一直跑满标称功耗,尤其是逐字生成的decode阶段,压力常常在显存带宽,不一定在算力。也就是说,用标称功耗算出来的电费更接近理论上限,不是精确预测。

至于二手显卡价格,这次不写具体数字。查证过程中,同样是“RTX3090二手”,不同渠道给出的价格从一千多到七千多都有,时间、地域和成色口径对不上,很难找到一个近期可信的统一价格。与其给一个可能过时或失真的参考价,不如把这一栏留给你自己,用实际能拿到的报价代入。

四、云端全成本:不只是token单价

对比API成本时,不能只看官网挂的总价。至少要拆成输入、输出、缓存命中、缓存未命中四档。以DeepSeek 2026年8月17日生效的峰谷定价表为例,缓存未命中输入价约为缓存命中输入价的30倍,这个差距经常比“高峰和平时”的差距更影响账单——但这个倍数同样是时效性数据,如果DeepSeek后续再调价,比例关系也可能变化,发文前务必回官网核实是否仍然成立。

这里还要引入一个比token单价更关键的指标:

有效任务成本 = 总花费 ÷ 合格可用结果数

比如,一个模型每次调用更便宜,但十次里只有三次能直接用;另一个模型贵一些,但十次里有八次能用。账面单价低的那个,实际有效成本反而可能更高。

这也是很多本地部署账算错的地方:拿本地小模型的低成本,直接和云端大模型的高成本比,看起来本地划算,却忽略了本地模型可能需要更多次重试,才能得到一个合格结果。

本文这次没有做完整的多场景批量测试,也没有实测Qwen3.8-27B在3090或4090上的真实生成速度,所以这里只给计算方法,不代入token/s。如果你自己动手测过,把实测速度和合格率代入下面的表,会比任何网上流传的估算都准确。

五、打平点:两条成本曲线的交点

回本周期不该是一次性除法,而是两条随时间累积的曲线:

本地累计成本(t) = 购入价 − t时残值 + 累计电费 + 累计维护 API累计成本(t) = 累计输入费 + 累计输出费

两条曲线第一次相交的时间点t,就是真实回本周期。

建议给自己算两个版本。一个是纯现金口径,不计自己折腾环境的时间;一个是完整口径,把安装、调试、故障排查的时间也按经验估个价折算进去。两个版本都留着,比争论“我的时间值不值钱”更有意义。

如果还想把速度也算进去,就要加一个吞吐约束:

本地每月可处理token量 = 实测token/s × 每日有效运行秒数 × 每月运行天数

如果你的任务量超过这条上限,本地机器就不是“成本更低”的问题,而是根本处理不完。没有实测token/s时,可以先算现金账,但不要把它当成完整的吞吐账。

六、三种用户画像

轻度个人用户,比如偶尔问答、偶尔总结资料,一天几十次请求以内,API大概率更划算。尤其是在DeepSeek这种价格体系下,靠省token费买一整台设备,很难算出漂亮的回本周期。

重度开发者,比如每天有几小时稳定的编程助手或知识库需求,而且已经有一台能加显卡的电脑,开始进入值得认真算一算的区间。

工作室或固定批量任务,比如每天要处理大量固定格式的数据,或者7×24小时跑推理,利用率越高,硬件折旧摊得越薄,自建的经济性会明显提升。

七、两个反直觉的结论

第一个:有的人无论用多久都回不了本。如果本地每完成一次任务的分摊成本,也就是电费、硬件损耗和运维投入加起来,本身就高于对应的API费用,那么用得越多亏得越多。这不是“再等等就回本了”的时间问题,而是结构问题。

第二个:显卡会贬值,模型能力却在升级。API真正的对手不是你今天在用的这个模型,而是未来一两年里不断降价、不断变强的下一代模型。你的本地设备买定之后,显存上限就定死了。DeepSeek几个月内价格体系多次变化,本身就是“云端在变、硬件不变”的例子。

八、什么场景不该自建,什么场景值得

如果你的核心需求是一直用最好的模型,或者月度API账单本来就不高,或者你完全不想折腾驱动、量化、推理框架这些事,继续用API更省心。

真正值得自建的,往往不是追最强模型,而是“足够好的模型×极高的使用频率”:固定格式的信息抽取、内部知识库问答、文档分类、批量文本改写这类任务,中等规模的开源模型通常已经够用,你也不需要为云端顶级模型的能力溢价买单。


九、给你一张能直接抄走的回本计算器

把下面这些参数填成自己的真实数字,就能算出属于你的回本月份:

参数

你的数据

整机/显卡购入价

用你实际能拿到的真实报价

预计N年后残值

参考同型号当前二手行情估算

显卡标称功耗

官方参数,注意这是理论估算口径

当地电价

元/千瓦时

预计每日运行小时

按你的实际使用强度填

每月维护/额外成本

可选,存疑就先填0

预计每月输入token量

百万token为单位

预计每月输出token量

百万token为单位

缓存命中输入占比

没有稳定重复prompt就别高估

当前API缓存命中输入单价

发文或计算当天现查

当前API缓存未命中输入单价

发文或计算当天现查

当前API输出单价

发文或计算当天现查

本地实测token/s

没测就留空,不要硬填网上数据

本地任务合格率

用同一批任务测,不要凭感觉估

API任务合格率

和本地用同一批任务比较

API月成本可以这样算:

API月成本 = 缓存命中输入量 × 命中输入单价 + 缓存未命中输入量 × 未命中输入单价 + 输出量 × 输出单价

本地月成本可以这样算:

本地月成本 = 月折旧成本 + 月电费 + 月维护成本

其中:

月折旧成本 =(购入价 − 预计残值)÷ 使用月份数

如果要算有效任务成本,再除以合格结果数:

本地有效任务成本 = 本地月成本 ÷ 本地合格结果数 API有效任务成本 = API月成本 ÷ API合格结果数

最后把本地累计成本和API累计成本按月画成两条线,第一次相交的月份,就是你的回本月份。如果两条线一直不相交,就说明在这组假设下,本地自建并不会回本。

如果只算人民币,多数轻度使用者可能会发现,API比想象中便宜得多。一张显卡买到的也不只是免费token,它还包括数据留在本地、没有调用次数焦虑、模型完全由自己控制,以及一块固定属于自己的算力。

回本周期没有统一答案,它取决于你的使用曲线落在计算表的哪一段。觉得这套算法对你有用,欢迎点个在看、加个星标,也欢迎在评论区留言你手头的显卡型号和主要用途,后面会挑几个真实案例专门写一篇。

资料边界说明

  • • 官方页面:Qwen3.8-27B模型规格来自HuggingFace官方模型卡(Qwen/Qwen3.8-27B);RTX3090、RTX4090标称功耗来自NVIDIA官方产品页;DeepSeekAPI定价信息(含峰谷定价及缓存价差倍数)核实于2026年8月21日,发文前请重新核对官网当日价格,价差倍数也可能随新一轮调价改变。

  • • 账号自有方法论:折旧计算思路沿用本账号《显卡三年后不值钱》一文的核心模型。

  • • 方向性估算,非实测:本文电费按显卡官方标称功耗理论估算,未做插座端整机实测;涉及生成速度的部分未做本地实测,本文只给出计算方法,不代入具体token/s。

  • • 未提供具体数字:二手显卡价格因缺乏近期可信的统一来源,本文不提供示例价格,计算器中该项留空,请读者自行代入真实购买渠道数据。


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
上海市发改委副主任朱明林,拟任新职!施明光,任三明市政府副秘书长、市政府办公室主任!

上海市发改委副主任朱明林,拟任新职!施明光,任三明市政府副秘书长、市政府办公室主任!

健身狂人
2026-08-29 00:42:22
为啥各大车企都纷纷推出HEV混动车型?内行人:原因很直白

为啥各大车企都纷纷推出HEV混动车型?内行人:原因很直白

离离言几许
2026-08-27 17:20:52
普京最新发声:俄罗斯正为现在和未来而战,每个人都关系“共同胜利”

普京最新发声:俄罗斯正为现在和未来而战,每个人都关系“共同胜利”

桂系007
2026-08-29 00:00:02
瑞士游客因违反巴厘岛“静默日”规定,被判一年监禁

瑞士游客因违反巴厘岛“静默日”规定,被判一年监禁

摄影笔记
2026-08-28 08:28:33
台湾终极解决方案:土地回归中国,人员往来自由,逃走不是中国人

台湾终极解决方案:土地回归中国,人员往来自由,逃走不是中国人

史行途
2026-06-25 05:56:31
官方回应“女子光脚踩进超市散装大米中”:用时一天,排查到事发在一个乡村小超市,女员工踩上去理货,已立案调查

官方回应“女子光脚踩进超市散装大米中”:用时一天,排查到事发在一个乡村小超市,女员工踩上去理货,已立案调查

蓬勃新闻
2026-08-28 17:31:04
最狠车臣将军带200特种兵血洗夜总会:拒5千万赔偿,只提一个要求

最狠车臣将军带200特种兵血洗夜总会:拒5千万赔偿,只提一个要求

小哥很OK
2025-11-29 09:04:10
许家印的父亲许贤高,1938年16岁时参加革命,同年参军并入党,因屡立战功曾担任骑兵连连长

许家印的父亲许贤高,1938年16岁时参加革命,同年参军并入党,因屡立战功曾担任骑兵连连长

人生录
2026-08-26 00:05:15
血脂升高,腿先知!若双腿频繁出现4种异常,说明你的血脂早脱缰

血脂升高,腿先知!若双腿频繁出现4种异常,说明你的血脂早脱缰

周哥一影视
2026-08-29 01:26:00
第33届金鹰奖宣布延期举行:人民至上、生命至上,文艺工作者永远和人民同呼吸、共命运

第33届金鹰奖宣布延期举行:人民至上、生命至上,文艺工作者永远和人民同呼吸、共命运

极目新闻
2026-08-27 19:55:51
我才28岁就成了寡妇,那晚公公让我喝下一杯酒,醒后我笑出了眼泪

我才28岁就成了寡妇,那晚公公让我喝下一杯酒,醒后我笑出了眼泪

千秋文化
2026-06-16 19:21:08
美军喊话台湾:一旦解放军动手,只要撑住1个月,美军就能登陆

美军喊话台湾:一旦解放军动手,只要撑住1个月,美军就能登陆

何咯说
2026-08-27 14:32:00
16GB+2TB!苹果新品突然上架:8月27日 ,正式预售

16GB+2TB!苹果新品突然上架:8月27日 ,正式预售

科技堡垒
2026-08-26 11:23:03
黄永胜回忆录:曾说过许多人的坏话,却唯独对这三人始终发自内心地敬佩不已

黄永胜回忆录:曾说过许多人的坏话,却唯独对这三人始终发自内心地敬佩不已

沆砀无垠
2026-08-27 08:10:03
60岁巩俐现身上海,皮松肉垮发缝宽,走路含胸驼背,撞脸张艺谋

60岁巩俐现身上海,皮松肉垮发缝宽,走路含胸驼背,撞脸张艺谋

秋姐居
2026-08-14 14:34:32
大连船坞320米巨舰成形,美国人比中国人还紧张:很大可能是核动力

大连船坞320米巨舰成形,美国人比中国人还紧张:很大可能是核动力

张斌说
2026-08-28 18:40:20
为什么都在宣传用了新能源车就回不去了?看网友评论:引万千共鸣

为什么都在宣传用了新能源车就回不去了?看网友评论:引万千共鸣

另子维爱读史
2026-08-04 21:35:07
越扒越有!上汽反水举报打脸韩红,救护车无授权,到底谁在说谎

越扒越有!上汽反水举报打脸韩红,救护车无授权,到底谁在说谎

一盅情怀
2026-08-28 11:29:07
是时候揭开真相了:当年对越作战的损失或许远超人们想象,仅从那些牺牲的将门之后就能看出端倪

是时候揭开真相了:当年对越作战的损失或许远超人们想象,仅从那些牺牲的将门之后就能看出端倪

人生录
2026-08-26 00:05:15
65岁宋丹丹被曝做财产公证,坐拥12亿资产,每月给儿孙80万生活费,却没给现任丈夫赵玉吉留一分。

65岁宋丹丹被曝做财产公证,坐拥12亿资产,每月给儿孙80万生活费,却没给现任丈夫赵玉吉留一分。

背包旅行
2026-08-26 15:33:59
2026-08-29 03:40:49
侃故事的阿庆
侃故事的阿庆
几分钟看完一部影视剧,诙谐幽默的娓娓道来
695文章数 9384关注度
往期回顾 全部

科技要闻

AI牛马永不下班!OpenAI让智能体自己找活

头条要闻

杭州知名酒店关门:店招系金庸题写 10年前曾一桌难求

头条要闻

杭州知名酒店关门:店招系金庸题写 10年前曾一桌难求

体育要闻

曼城花1个亿,买下了摩洛哥的“国民女婿”

娱乐要闻

景甜分手风波,网友:难怪张继科抽身

财经要闻

刑自强:AI投资下半场中国蓄势待发

汽车要闻

东风日产NX8“喜柿橙意”限定色正式上市

态度原创

房产
健康
教育
数码
家居

房产要闻

突发,三亚又大量卖地!

脑出血两大夺命风险,早治早保命!

教育要闻

2027届注意!上纽、昆杜综合评价如何选?

数码要闻

街电推出三合一笔记本移动电源,支持67W快充,活动价398元

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版