DeepSeek马上要涨价了。
我最近在狂算账,算得有点心慌。毕竟现在工作流里只要批量跑的需求都是V4 flash做的,也没怎么细看过账单,反正便宜,一周掏个一两百就也差不多了。
说要涨价也没说到底要涨的多少,又时不时听到点小道消息说会大幅度涨还不止两倍。我的心情就be like,
![]()
正好这段时间,省Token Skill扎堆冒出来,我就想趁现在便宜,先把功课提前做了。我收集了Caveman、Ponytail、Headroom、Graphify、Codex Token Skills、Codex Token Saver这六个Skill,看看到底哪个最省钱,省钱还不能降低质量的那种。
这六个skill的数字一个比一个猛。有的说输出能少65%,有的说400行代码能压到23行,还有的直接喊账单能砍70倍。70倍是一个什么概念?也就是说我跑完一个项目,梁圣说不定还得给我钱。
这六个Skills的省token的方向还是非常不同的。
先说Caveman,六个里最火的那个。
它干的事最好懂,让模型闭嘴。删掉寒暄的语句,删铺垫,删免责声明,删那种写完了还要把刚说过的话再总结一遍的毛病。只留结论,动作和代码。Github上的聊天基准给出的数据是平均输出从1214个Token降到294个,少65%。
另一个Ponytail(马尾辫)完全是另一个方向。
为了不重复造轮子,Ponytail会在Agent动手之前一层层盘问,已有实现能不能用,标准库能不能做,平台原生能不能做,已装的依赖能不能做,一行代码能不能解决。全都不行,才允许Agent写新的。传播最猛的数字是代码量能少92%到94%。
Headroom管得更上游一点,压缩我们给Agent的上下文长度,比方说重复的日志文件,大段大段的代码,有选择性的塞到对话框里,扔掉的部分先存在本地,要细节的时候再捞回来,据项目说的是能省60%到95%的token。
Graphify更狠,嫌弃Agent每次都在重读同一个项目。每开一个新会话就得把整个仓库从头读一遍。那不如提前把代码和文档解析成一张本地知识图谱,之后查图就行。就是它说能砍70倍账单的。
Codex Token Skills走又是另一条路子,它主打一个机制,把稳定不变的规则放在对话最前面,这样重复的前缀就有机会命中DeepSeek的上下文缓存,命中之后输入价格更低。这个说是能省60%到80%。
最后一个是Codex Token Saver,极致偷懒,每次回复一句话最多三条,能不截图就不截图,除非到改代码前不然不读文件,用户不要求的话不测试不构建,失败只重试一次。这样节省输出后能省50%到80%。
好,六个数字摆完了。
65%,94%,95%,70倍,80%,80%。
看着是挺爽的。全部安上估计100块能用一年的样子,所以我们直接上API来压力测试看看效果,每个Skill配一道编程题,六个Skill再加一个不装Skill的当对照组,然后用GPT和Claude盲评打分。
API全程固定DeepSeek V4 Flash,开thinking。
OKOK,Here we go,一个个吐槽。
01|Caveman
先是Caveman,算是最火的一个,通过教Agent说文言文来省token。
我给它配的题是一句话生成一个新粗野主义网页,尽可能极具创意,带滚动动画和花哨配色,页面标题dorksense。
不装Skill,输出是533行29393个字符。装了Caveman,输出634行34027个字符。
行多了18.9%,字符多了15.8%。
拆开来看的话CSS规则从90条涨到119条,函数从16个涨到28个,连注释都从24处涨到29处。
![]()
![]()
左边没加Caveman右边加了Caveman
Caveman能删的是解释,可这道题要的是几百行HTML。没有解释可删,Skill那套规则就成了纯增量。而且它自己的规则也是占输入Token的。每轮大约增加1000到1500个输入Token。
这就像为了让同事少说两句,先给他发一份1500字的以后说话要简洁的书面通知。还是来看看效果吧,
【没加Caveman】
【加了Caveman】
离谱的是我抽了三次,加了Caveman的效果都不没有下滑,反而比裸Prompt好了不止一点。
画面不偏移了,稳定度也上来了,代码整体的解析也是稳了很多。
02、03|Codex Token Skills和Headroom
这两个skill踩的是同一个坑,能省多少,取决于输入里有多少可以省。
我给Codex Token Skills出的题,是按照一份详细设计稿实现深色 Hero。
写的非常详细啊,背景色,模糊元素偏移215px宽801px高384px模糊77.5px,标题Inter中等76px字距负2px,副标题Manrope 18px行高26最大宽613px,按钮背景。规格密密麻麻写了一大段。
这种任务其实很难减少输入Token,因为每个数字都是实现要求,必须读完,少看一条,最后的页面就可能不一样。
实际数据也说明了这一点,没用之前,输入是42.1kToken,输出是12.8k Token,花费约 0.56 美元,API 用时 1 分 15 秒。
用了之后,输入增加到46.7k Token(因为skill本身也占token),输出降到了4.4k Token,花费降到约0.365 美元,API 用时也缩短到 29 秒。最终生成的代码从 356 行增加到 387 行,页面效果却几乎看不出差别。=
![]()
左边没加Codex Token Skills右边加了
我是看不出区别,Skill用了缓存保了要实现的页面规则也出来了,爽翻了简直。
安装的时候还有个小坑顺带提一句。这个仓库的memory Skill里写死了作者自己的Windows路径,C盘用户名都还在,要改成本机路径才能跑。
那Headroom的作用很像是帮模型整理资料。
如果交给模型的内容本来就很短、很干净,它几乎帮不上忙。我们用几个简单任务测试时,三次全部判定no-op(不启动),0Token压缩,因为里面本来就没有多少可以删掉的内容。
但当输入非常长,而且夹杂着大量日志、重复代码和工具返回结果时,它的效果就比较明显了。
第一个任务是让模型检查一份很长的 CSS 文件。原始材料大约有1.65万 Token,其中包含报错信息、重复内容和工具输出。Headroom 整理之后,只剩下约 8500 Token,减少了大约 48.5%。
![]()
第二个任务是让模型阅读大量日志,找出最值得修复的三个问题。
没有使用 Headroom 时,两次测试的输入分别是16,533 Token,模型输出分别用了4,000和2,309Token。第一次还碰到了输出上限,回答被中途截断。
用了Headroom 后,输入分别降到8,505 和 8,505 Token,减少了约 48.6%。模型输出只用了1,536 和1,606 Token,两次都完整写出了三个问题、对应证据和修复方案。
也就是说,Headroom不只是把输入压短了。它还减少了模型在重复日志和无关信息中找重点的消耗,模型可以用更少的输出 Token,给出更完整更集中的答案。
04|Ponytail马尾辫
它的思路是拦住模型那种「我可以顺手给你搭一个完整系统」的冲动。动手之前一层层往下问,标准库能不能做,平台原生能力能不能做,已装依赖能不能做,一行代码能不能做。都不行才开始造新东西。
我给它配的是做一个卡通激光眼,一道要调MediaPipe做人脸关键点,再把激光束画出来的题。
不装Skill,675行21404个字符,装了Ponytail,488行14916个字符。行少27.7%,字符少30.3%。CSS规则从69条降到35条,砍了一半。函数从22个降到12个,砍了45%。script标签从2个变成1个,注释从70处降到31处。
![]()
规则少了一半,但功能一个没少。
我自己做UI的时候就经常踩这个坑。明明只要一个小交互,最后多出一套状态管理,一组重复组件,几个用不上的工具函数。Ponytail就像一个会在你按回车之前问一句「真的需要吗」的同事。
不过他们项目自己说的能省92%到94%的token得单独拎出来说一下。那两个数对应的是代码行数,不是平均Token降幅,这怎么不算数字的艺术呢。
05|Codex Token Saver
六个里省得最猛的那个。
![]()
它的规则包括改代码前不读文件,非用户要求不测试不构建,默认零验证,失败只重试一次。
作者宣称能省40%到70%,不过跟前面那个Codex Token Skills一样,仓库里也没有任何公开基准。
我给它的题目是TOONHUB,一个3D角色轮播UI,要求四个角色卡片式切换展示。不装Skill的话,509行18695个字符,装了token-saver,61行5396个字符。行少88%,字符少71.1%。
我第一反应是它偷工减料了,逐条去对功能。但是功能一个都没少。只看压缩率,这确实是所有测试中最夸张的一组。但把四张角色卡片放大后,问题就出现了。
【没加Token Saver】
【加了Token Saver】
不装Skill那版,画了4个SVG,四个角色造型各不相同。token-saver那版,只写了1个SVG模板,然后用JS循环四次,换四种颜色。
所以这次测试更准确的结论是,Token Saver的代码压缩率确实高,基本交互也保留了,但它把原本应该独立设计的四个角色过度合并成了一套模板,牺牲了角色差异和设计质量。
06|Graphify
是反转最多的一个。
它太容易被误读了。71.5倍的省token是来自一个旧版项目在一个特定大型混合语料上的每次查询对照,不是总token账单减少71.5倍。我给它造了一个79文件的TypeScript仓库,src下面有auth,billing,api,ui,db,utils,再加四篇文档,里面埋了真实的跨文件调用链。然后出了20个必须跨文件才能回答的问题。
![]()
一组是每次重读相关文件,一组是先建索引之后只查索引。20个问题跑完,单查询输入平均从583.5降到163.8。3.56倍。
所以说,不是70倍,也不是10倍,是3.56倍。
Graphify的逻辑其实就是先花一笔Token建图,建索引,再靠后面的查询慢慢把成本摊回来。
单看查询阶段确实省很多,因为不用每次重新扫整个仓库。但问题是,建图本身也很贵。
这次 79 个文件全读一遍,大约就花了3万Token。问了十几个问题以后,不建图总共用了28,586 Token。建图那组加上索引成本,反而用了42,281 Token,多了 48%。
按这个降幅推,大概要在同一份索引上问到 36 次左右才开始回本。
所以一次性项目大概率划算,只有长期,复杂,而且会被反复查询的仓库,前面的建图项目大了成本才摊得回来。
最后的最后,
前面六个Skill各做各的题,有的确实省了,有的反而加了。可题目不一样,难度不一样,天然对不同方向的Skill有利有弊,横向没法比。
所以我换了一种打法,开目标模式,把六个Skill全拉到同一道题上重新跑。这次的题目是电影感FIFA世界杯网站,要求做一个有电影质感的世界杯落地页,48支球队104场比赛,带倒计时。
模型统一DeepSeek V4 Flash开thinking,输出上限64K。评分交给GPT-5.6-sol和Claude Opus 4.8各来一遍,七个版本匿名映射成A到G,评审只看需求原文加截图加HTML,看不到哪个是哪个。六个维度加起来100分,视觉25,需求符合25,交互20,稳健15,响应式和可访问性10,实现效率5。
效果是这样的,
![]()
![]()
六个号称省Token的项目,一个都便宜。
![]()
Headroom是平的,因为这道需求只有280个Token,压不动。剩下五个全在加钱,最少的加33.5%,最多的加222.8%。
六个的质量分数,全部持平或者更高,一个降的都没有。
分最高的是Graphify,93.5分。不装Skill那版是一张平的深色页,标题加倒计时加两个按钮。Graphify那版直接把整个球场看台做成背景,ONE WORLD ONE GAME ONE DESTINY三行大字压上去,底下铺了48队104场16城1座奖杯的数据条。Codex Token Saver那版走的是另一个方向,左边文案右边奖杯,衬线大标题WHERE LEGENDS RISE,底部一条跑马灯。81K的HTML,全场最大。
它俩都没有在省token的,反而是猛加。
到这我就有点想不通了,钱到底加在哪了。页面是更好看了,但也没多出这么多代码啊。
然后我去翻了使用额度里那个叫reasoning_tokens的字段,可以理解成模型的思考过程。
不装Skill那版,模型想了12420个Token,写出来18098个。装了Codex Token Skills那版,模型想了36217个,写出来18728个。它多花的24717个Token里,有23797个是thinking,可见的输出只多了630个。
96%的新增开销,是模型多想了一会。交到你手上的东西,几乎一个字没多。
![]()
这就是这批Skill尴尬的地方。
写的每一条规则,模型都得先读进去,理解,然后在动笔之前多想一轮,这条规则跟我要做的事怎么协调。规则越多越严,它想得越久。
而thinking在这道题上,不装Skill就已经占了40.3%,装上Codex Token Skills之后涨到65.2%。
三分之二。。。
辛辛苦苦算的那几笔账,输出,代码,上下文,缓存,管的全是模型说出来的那部分。真正在烧钱的,是它没说出来的思考部分。
前面单独跑的时候,这个问题不明显。一开目标模式,Skill的规则再叠上来,它在动笔之前就得多想一轮又一轮,这条约束跟质量目标怎么协调,那条规则和创意方向打不打架。thinking比例从四成拉到六成以上,前面省下来的那点输出和输入,就已经全被思考的开销吃干净了。
所以跑完这一轮我最大的感受是,
可能从一开始就把这些skills的定位搞错了。
它们不是省钱工具,说到底也还是是约束工具。
简单任务里,约束确实能砍掉废话、重复和多余代码,实打实省钱,数据摆在那。
但只要你的场景稍微复杂一点,只要你对质量有要求,约束就反过来变成额外的思考负担,账单也跟着涨。
所以,回到最开始那个问题,哪个值得装。
这取决于我们拿它去做什么。
日常任务,规则明确,对质量没有竞争性要求,Ponytail我会留着,Headroom我也留着。
其他的等我晚点用Claude合并搓一个新的质量无损Skill出来吧。
许愿一把DeepSeek晚点再涨价,
等我马上再去烧一轮额度。
话说为了省token而烧更多的token,
这算左右脑互搏吗?
@ 作者 / 卡尔
最后,感谢你看到这里如果喜欢这篇文章,不妨顺手给我们点赞|在看|转发|评论
如果想要第一时间收到推送,不妨给我个星标
如果你有更有趣的玩法,欢迎在评论区聊聊
更多的内容正在不断填坑中……
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.