![]()
![]()
2026年8月13日晚上,工程师GDP(@bookwormengr)盯着屏幕上的Harness界面,底部状态栏清清楚楚写着 Cache hit 98% 。
他截了图,发了一条帖子,大意是: 别慌,DeepSeek涨价了也还是很便宜。
他的逻辑不复杂,跑了长任务,缓存命中率高得离谱,输入成本被压到地板,就算单价涨了,总账依然好看。
看起来是一颗定心丸
但如果你翻开同一时刻DeepSeek官方贴出的新价表, 心会凉半截 :那条帖子里引以为傲的“98%命中率”,对应的 缓存命中单价 ,恰恰是这一轮涨价里 涨得最狠的一栏 。
最高+1114% ,也就是 12倍
高命中不再是护身符,它可能是新价表里最贵的陷阱。
![]()
种子帖配图:Harness状态栏显示 Cache hit 98% ,模型为 DeepSeek-V4-Pro High
一张价目表引发的“算术恐慌”
先看数字
DeepSeek官方定价页在8月中旬完成了两套价格体系的切换: 旧价 时代,V4-Pro输入·命中价仅为 $0.003625/百万token ,便宜到可以忽略不计;
新价 时代,这一栏变成 低谷$0.022、高峰$0.044 。
近似的参照是:你常去的食堂突然把最不起眼的米饭价格,从三毛钱涨到了三块六。
涨幅整理最显眼的部分来自可视化:用户@Im_IrushiK贴出的统计图显示, V4-Pro缓存命中最高涨约+1114%,缓存未命中最高+203%,输出最高+355% 。
也就是说,过去被开发者当作“白嫖区”的缓存命中,现在成了价格杠杆上 被拧得最紧的那颗螺丝 。
更复杂的设定在于 分时计价 :自2026年8月16日16:00 UTC起,UTC 01:00–04:00与06:00–10:00被标为高峰,峰值价是低谷的两倍。
换算到北京时间, 高峰恰好落在上午9点到中午12点、下午2点到傍晚6点 ,正是东亚开发者坐在工位前跟AI配对编程的黄金时段。
这使白天的交互任务更容易碰到高峰价,同一张价目表会随当地作息呈现不同体感。
![]()
官方定价页下半段:完整新价表,Flash/Pro × 低谷/高峰四档组合
98%怎么出现,为什么仍会失手
要理解这场风波的 本质 ,得先理解一个技术事实: agent的账单,几乎是命里注定要被“缓存”支配的。
大模型按token计费
一个Coding agent跑长任务时,开头的系统指令、项目地图、历史对话、工具结果,会在几十上百轮调用里被 反复送回服务端 。
如果每次都从头算一遍,推理成本是天文数字。
缓存机制救了这个场景: 只要请求的开头跟前一次高度重合,服务端就直接从磁盘“读”出中间状态,不再重算,并且按更低的价格计费。
DeepSeek把这个机制用得近乎激进:文档写明缓存默认开启, 闲置后通常数小时到数天才清除 ;
而Anthropic的Prompt Caching默认TTL只有约 5分钟 (可选1小时)。
这正是GDP那条帖子的核心洞察: 午饭离开工位一小时,再回来继续会话,在Anthropic那边缓存多半已经死透,整段上下文按全价重算;
在DeepSeek这边,前缀大概率还活着。
但这里有一条 反直觉的工程红线 :缓存命中要求 完整前缀匹配 ,语义相似还不够。
若harness每一轮都打乱前缀顺序、频繁切换system prompt、或把不稳定内容插在最前,命中率会断崖下跌。
反过来,能稳定复用同一前缀的harness,可以把命中率推到极限。
98%就是这么来的, 它是一次工程胜利,不能视为合同保障 。
官方文档明确注明: 缓存是best-effort,不保证100%。
于是,当新价表把“命中”这个曾经最便宜的档位单独提价12倍, 依赖高命中率跑通的工作流,等于掉进了一个专门为它们设计的定价陷阱 。
你越是擅长省钱,越会被精准征收
用户@web3tasks在种子帖下的回复一针见血: “V4 Pro的命中缓存价涨了6/12倍,输入输出只涨了1–2倍。 高命中率才是陷阱”
![]()
用户@web3tasks的反驳:高命中率本身成了被重点涨价的对象
Harness同框出场的真相:编排层成了可替换商品
价格表公布的同一天,DeepSeek Harness(DSH)以MIT协议开源,冲上GitHub约 9.3万星 。
落地页第一屏写着: “Everything is a plugin.”
这绝非巧合
社区开发者Jiayuan(@jiayuan_jy)的长帖点破了这层关系:DSH可以直接运行coding agent,框架层则像 乐高玩具 ,官方Coding Agent只是官方预置拼法, 模型、工具、Shell、沙箱、会话存储、UI,甚至Agent Loop本身都是插件 ,随时可以替换。
缓存命中率由此成了可以fork、调试和优化的工程对象。
![]()
官方Harness落地页:深色首屏,“Everything is a plugin”
因为命中率高度依赖 上下文如何被拼进请求 ,这正是harness的职责。
谁能稳定产出高命中轨迹,谁就能在涨价后仍然交出更低的 有效成本 。
GDP帖子里的对照实验,同一任务下DSH的token消耗低于Codex harness,虽然只是个人观察,但指向了同一个结论: 在价目表之外,harness选择是能掰动账单的高杠杆项。
中文用户@zxlz668也贴出实测: 99.3% 的命中率并非DSH独有,自己优化后的框架也能稳定在98%以上。
这反向印证了: 98%可以通过工程持续逼近,已经接近一项运营指标 。
问题只在于,当命中价涨了12倍,你的命中率还能撑得住你的预算模型吗?
三层市场与三张表:算清楚你骂的到底是哪一层
一个容易被忽略但至关重要的区分在于,DeepSeek的“涨价”其实发生在 三层市场 里:
- 官方API层
:8月16日生效的peak/off-peak新表,缓存命中从$0.003625跳到$0.044;
- 第三方宿主层
:OpenRouter、DeepInfra、各云厂商的转发价,缓存深度、TTL、前缀规则差异巨大,有文章称 cache-read单价可差数十倍 ;
- 自托管层
:本地跑量化模型,省了API贴纸,换来GPU账单与自建缓存系统的工程成本。
媒体Computerworld援引分析师的观点切中了要害: 高峰纸面价 上,DeepSeek对部分竞品的绝对优势会“消失甚至局部反转”;
但若把 低谷17小时 和 98%命中深折扣 叠加进去,会算账的买方仍能 把相当一部分优势赚回来 。
时间本身,成了经济变量
![]()
外媒报道:部分V4价格涨幅超10倍,但off-peak与缓存折扣让影响更复杂
云成本观察者CloudZero则提供了一个财务视角的提醒: 企业TCO模型中最敏感的单元格,恰恰是原来最被忽视的那一列,命中率。
当8月新价把这一列猛涨12倍,所有Excel表格都被迫重新计算。
三个可操作的动作,比恐慌有用
把材料摊开,结论并不复杂 涨价是事实,但恐慌不需要
第一步,量自己的命中率
从 prompt_cache_hit_tokens 和 prompt_cache_miss_tokens 回放你的真实工作负载。
如果你根本没有多轮长会话、前缀高度多变,受冲击的重点会落在未命中和输出的全面上涨上,涨价体感更直接。
第二步,把可延迟任务挪进低谷
一天24小时里约17小时是半价
批量评测、大规模重构、回放任务,没有理由留在高峰时段交智商税。
第三步,把harness当作成本工程来做。
前缀稳定性、会话存储策略、工具结果拼接顺序,这些看似无聊的“编排细节”,在新价表下直接等于真金白银。
DeepSeek Harness的开源,恰好给了你 自己动手 的权利。
这轮涨价最有意思的地方在于:DeepSeek一边把缓存命中这个曾经最便宜的东西标上最贵的涨幅,一边把能操控命中率的那层编排代码开源给了所有人。
这是一场关于“有效价”的考试
98%命中率不再是免死金牌,但会调配的人,仍然有账可算。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.