本文是“要不要自建本地推理”决策系列的收束篇,衔接此前《GPU报价怎么看》《显卡三年后不值钱》《12个本地模型实测》三篇。文中价格与产品信息查证于2026年8月21日,云厂商定价变动频繁,请以官网当日信息为准。
很多准备跑本地大模型的人,算的是这样一笔账:
一张二手RTX3090,几千块。API每个月花几十上百块。那两三年总能把显卡钱省回来吧?
这个算法不严谨的地方在于:显卡会贬值,推理本身要耗电,本地模型和云端模型不一定是同一个能力等级,API价格也在快速变化。
本文无法准确给出“3090几年回本”的现成答案,讨论一套我们自己能代入的算法——多数人只算了“卡多少钱”,没算折旧、电费、残值和运维时间,真实回本周期通常比直觉更长。
一、两边卖的不是同一个东西
API卖的是模型能力、GPU、运维和弹性资源打包后的服务。本地机器是一台固定资产。直接拿“显卡价格÷月度API账单”做除法,是把一次性固定支出和持续变动支出混在了一起。
更麻烦的是,本地能装下的模型量级,和云端顶级模型往往不对等。如果你比较的是本地一个量化过的中等模型,和云端最强旗舰模型,这就不是“买还是租”的问题,而是比较对象本身不公平。所以第一步,要先选一组能放在一起算的基准。
二、选定基准:一款新模型,两种24GB显卡![]()
本文用Qwen3.8-27B做本地侧的对照模型。HuggingFace模型卡显示,它是27B参数模型,权重文件约55.6GB。这个体积很关键:24GB显卡不能直接跑BF16原始权重,实际部署要走量化路线,还要看上下文长度、推理框架和显存占用。
硬件侧选两档:RTX3090和RTX4090。它们都是24GB显存,官方功耗口径分别是350W和450W。3090代表“用较低成本进入24GB显存”的思路,4090代表“花更多钱换更快速度”的思路。
云端侧用DeepSeek当前API报价做对照。这里要特别提醒一句:DeepSeek过去几个月价格体系已经多次调整,5月下调过V4-Pro价格,之后又引入峰谷计费,8月17日正式上线峰谷定价,高峰时段价格较调整前上涨明显。这不是修辞,云端成本会变,本地硬件买定后基本就固定了。所以本文不把具体元/百万token数字写死,你发文或自己计算时,要去官网现查当天价格。
三、自建成本:不只是买卡那一下子![]()
硬件投入要分两种情况算。如果你已经有一台能用的电脑,只缺一张显卡,那只计算新增显卡成本。如果是专门为跑模型攒一台新机器,就必须把主板、内存、电源、散热和机箱都算进去。网上很多“3090跑本地模型只要几千块”的说法,算的往往只是显卡,不是一台真正能工作的机器。
折旧部分,用一个简单公式:
硬件消耗成本 = 买入价 − N年后能卖出的残值
这里有个容易踩的坑:不要同时“扣残值”又“再单独算折旧率”。两者是同一件事的两种算法,只能选一个,否则会重复扣钱。
电费部分,本文按显卡官方功耗做理论估算,没有做插座端实测:
电费 = 显卡功耗(千瓦)× 每日运行小时 × 电价 × 天数
这个估算有局限。真实使用中,CPU、主板、内存、风扇这些外围设备也会耗电;同时GPU推理时很少一直跑满标称功耗,尤其是逐字生成的decode阶段,压力常常在显存带宽,不一定在算力。也就是说,用标称功耗算出来的电费更接近理论上限,不是精确预测。
至于二手显卡价格,这次不写具体数字。查证过程中,同样是“RTX3090二手”,不同渠道给出的价格从一千多到七千多都有,时间、地域和成色口径对不上,很难找到一个近期可信的统一价格。与其给一个可能过时或失真的参考价,不如把这一栏留给你自己,用实际能拿到的报价代入。
四、云端全成本:不只是token单价
对比API成本时,不能只看官网挂的总价。至少要拆成输入、输出、缓存命中、缓存未命中四档。以DeepSeek 2026年8月17日生效的峰谷定价表为例,缓存未命中输入价约为缓存命中输入价的30倍,这个差距经常比“高峰和平时”的差距更影响账单——但这个倍数同样是时效性数据,如果DeepSeek后续再调价,比例关系也可能变化,发文前务必回官网核实是否仍然成立。
这里还要引入一个比token单价更关键的指标:
有效任务成本 = 总花费 ÷ 合格可用结果数
比如,一个模型每次调用更便宜,但十次里只有三次能直接用;另一个模型贵一些,但十次里有八次能用。账面单价低的那个,实际有效成本反而可能更高。
这也是很多本地部署账算错的地方:拿本地小模型的低成本,直接和云端大模型的高成本比,看起来本地划算,却忽略了本地模型可能需要更多次重试,才能得到一个合格结果。
本文这次没有做完整的多场景批量测试,也没有实测Qwen3.8-27B在3090或4090上的真实生成速度,所以这里只给计算方法,不代入token/s。如果你自己动手测过,把实测速度和合格率代入下面的表,会比任何网上流传的估算都准确。
五、打平点:两条成本曲线的交点
回本周期不该是一次性除法,而是两条随时间累积的曲线:
本地累计成本(t) = 购入价 − t时残值 + 累计电费 + 累计维护 API累计成本(t) = 累计输入费 + 累计输出费
两条曲线第一次相交的时间点t,就是真实回本周期。
建议给自己算两个版本。一个是纯现金口径,不计自己折腾环境的时间;一个是完整口径,把安装、调试、故障排查的时间也按经验估个价折算进去。两个版本都留着,比争论“我的时间值不值钱”更有意义。
如果还想把速度也算进去,就要加一个吞吐约束:
本地每月可处理token量 = 实测token/s × 每日有效运行秒数 × 每月运行天数
如果你的任务量超过这条上限,本地机器就不是“成本更低”的问题,而是根本处理不完。没有实测token/s时,可以先算现金账,但不要把它当成完整的吞吐账。
六、三种用户画像
轻度个人用户,比如偶尔问答、偶尔总结资料,一天几十次请求以内,API大概率更划算。尤其是在DeepSeek这种价格体系下,靠省token费买一整台设备,很难算出漂亮的回本周期。
重度开发者,比如每天有几小时稳定的编程助手或知识库需求,而且已经有一台能加显卡的电脑,开始进入值得认真算一算的区间。
工作室或固定批量任务,比如每天要处理大量固定格式的数据,或者7×24小时跑推理,利用率越高,硬件折旧摊得越薄,自建的经济性会明显提升。
七、两个反直觉的结论
第一个:有的人无论用多久都回不了本。如果本地每完成一次任务的分摊成本,也就是电费、硬件损耗和运维投入加起来,本身就高于对应的API费用,那么用得越多亏得越多。这不是“再等等就回本了”的时间问题,而是结构问题。
第二个:显卡会贬值,模型能力却在升级。API真正的对手不是你今天在用的这个模型,而是未来一两年里不断降价、不断变强的下一代模型。你的本地设备买定之后,显存上限就定死了。DeepSeek几个月内价格体系多次变化,本身就是“云端在变、硬件不变”的例子。
八、什么场景不该自建,什么场景值得
如果你的核心需求是一直用最好的模型,或者月度API账单本来就不高,或者你完全不想折腾驱动、量化、推理框架这些事,继续用API更省心。
真正值得自建的,往往不是追最强模型,而是“足够好的模型×极高的使用频率”:固定格式的信息抽取、内部知识库问答、文档分类、批量文本改写这类任务,中等规模的开源模型通常已经够用,你也不需要为云端顶级模型的能力溢价买单。
![]()
九、给你一张能直接抄走的回本计算器
把下面这些参数填成自己的真实数字,就能算出属于你的回本月份:
参数
你的数据
整机/显卡购入价
用你实际能拿到的真实报价
预计N年后残值
参考同型号当前二手行情估算
显卡标称功耗
官方参数,注意这是理论估算口径
当地电价
元/千瓦时
预计每日运行小时
按你的实际使用强度填
每月维护/额外成本
可选,存疑就先填0
预计每月输入token量
百万token为单位
预计每月输出token量
百万token为单位
缓存命中输入占比
没有稳定重复prompt就别高估
当前API缓存命中输入单价
发文或计算当天现查
当前API缓存未命中输入单价
发文或计算当天现查
当前API输出单价
发文或计算当天现查
本地实测token/s
没测就留空,不要硬填网上数据
本地任务合格率
用同一批任务测,不要凭感觉估
API任务合格率
和本地用同一批任务比较
API月成本可以这样算:
API月成本 = 缓存命中输入量 × 命中输入单价 + 缓存未命中输入量 × 未命中输入单价 + 输出量 × 输出单价
本地月成本可以这样算:
本地月成本 = 月折旧成本 + 月电费 + 月维护成本
其中:
月折旧成本 =(购入价 − 预计残值)÷ 使用月份数
如果要算有效任务成本,再除以合格结果数:
本地有效任务成本 = 本地月成本 ÷ 本地合格结果数 API有效任务成本 = API月成本 ÷ API合格结果数
最后把本地累计成本和API累计成本按月画成两条线,第一次相交的月份,就是你的回本月份。如果两条线一直不相交,就说明在这组假设下,本地自建并不会回本。
如果只算人民币,多数轻度使用者可能会发现,API比想象中便宜得多。一张显卡买到的也不只是免费token,它还包括数据留在本地、没有调用次数焦虑、模型完全由自己控制,以及一块固定属于自己的算力。
回本周期没有统一答案,它取决于你的使用曲线落在计算表的哪一段。觉得这套算法对你有用,欢迎点个在看、加个星标,也欢迎在评论区留言你手头的显卡型号和主要用途,后面会挑几个真实案例专门写一篇。
资料边界说明
• 官方页面:Qwen3.8-27B模型规格来自HuggingFace官方模型卡(Qwen/Qwen3.8-27B);RTX3090、RTX4090标称功耗来自NVIDIA官方产品页;DeepSeekAPI定价信息(含峰谷定价及缓存价差倍数)核实于2026年8月21日,发文前请重新核对官网当日价格,价差倍数也可能随新一轮调价改变。
• 账号自有方法论:折旧计算思路沿用本账号《显卡三年后不值钱》一文的核心模型。
• 方向性估算,非实测:本文电费按显卡官方标称功耗理论估算,未做插座端整机实测;涉及生成速度的部分未做本地实测,本文只给出计算方法,不代入具体token/s。
• 未提供具体数字:二手显卡价格因缺乏近期可信的统一来源,本文不提供示例价格,计算器中该项留空,请读者自行代入真实购买渠道数据。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.