网易首页 > 网易号 > 正文 申请入驻

赶在DeepSeek涨价前,我猛烧1千测了6个省token的Skills

0
分享至


DeepSeek马上要涨价了。

我最近在狂算账,算得有点心慌。毕竟现在工作流里只要批量跑的需求都是V4 flash做的,也没怎么细看过账单,反正便宜,一周掏个一两百就也差不多了。

说要涨价也没说到底要涨的多少,又时不时听到点小道消息说会大幅度涨还不止两倍。我的心情就be like,


正好这段时间,省Token Skill扎堆冒出来,我就想趁现在便宜,先把功课提前做了。我收集了Caveman、Ponytail、Headroom、Graphify、Codex Token Skills、Codex Token Saver这六个Skill,看看到底哪个最省钱,省钱还不能降低质量的那种。

这六个skill的数字一个比一个猛。有的说输出能少65%,有的说400行代码能压到23行,还有的直接喊账单能砍70倍。70倍是一个什么概念?也就是说我跑完一个项目,梁圣说不定还得给我钱。

这六个Skills的省token的方向还是非常不同的。

先说Caveman,六个里最火的那个。

它干的事最好懂,让模型闭嘴。删掉寒暄的语句,删铺垫,删免责声明,删那种写完了还要把刚说过的话再总结一遍的毛病。只留结论,动作和代码。Github上的聊天基准给出的数据是平均输出从1214个Token降到294个,少65%。

另一个Ponytail(马尾辫)完全是另一个方向。

为了不重复造轮子,Ponytail会在Agent动手之前一层层盘问,已有实现能不能用,标准库能不能做,平台原生能不能做,已装的依赖能不能做,一行代码能不能解决。全都不行,才允许Agent写新的。传播最猛的数字是代码量能少92%到94%。

Headroom管得更上游一点,压缩我们给Agent的上下文长度,比方说重复的日志文件,大段大段的代码,有选择性的塞到对话框里,扔掉的部分先存在本地,要细节的时候再捞回来,据项目说的是能省60%到95%的token。

Graphify更狠,嫌弃Agent每次都在重读同一个项目。每开一个新会话就得把整个仓库从头读一遍。那不如提前把代码和文档解析成一张本地知识图谱,之后查图就行。就是它说能砍70倍账单的。

Codex Token Skills走又是另一条路子,它主打一个机制,把稳定不变的规则放在对话最前面,这样重复的前缀就有机会命中DeepSeek的上下文缓存,命中之后输入价格更低。这个说是能省60%到80%。

最后一个是Codex Token Saver,极致偷懒,每次回复一句话最多三条,能不截图就不截图,除非到改代码前不然不读文件,用户不要求的话不测试不构建,失败只重试一次。这样节省输出后能省50%到80%。

好,六个数字摆完了。

65%,94%,95%,70倍,80%,80%。

看着是挺爽的。全部安上估计100块能用一年的样子,所以我们直接上API来压力测试看看效果,每个Skill配一道编程题,六个Skill再加一个不装Skill的当对照组,然后用GPT和Claude盲评打分。

API全程固定DeepSeek V4 Flash,开thinking。

OKOK,Here we go,一个个吐槽。

01|Caveman

先是Caveman,算是最火的一个,通过教Agent说文言文来省token。

我给它配的题是一句话生成一个新粗野主义网页,尽可能极具创意,带滚动动画和花哨配色,页面标题dorksense。

不装Skill,输出是533行29393个字符。装了Caveman,输出634行34027个字符。

行多了18.9%,字符多了15.8%。

拆开来看的话CSS规则从90条涨到119条,函数从16个涨到28个,连注释都从24处涨到29处。



左边没加Caveman右边加了Caveman

Caveman能删的是解释,可这道题要的是几百行HTML。没有解释可删,Skill那套规则就成了纯增量。而且它自己的规则也是占输入Token的。每轮大约增加1000到1500个输入Token。

这就像为了让同事少说两句,先给他发一份1500字的以后说话要简洁的书面通知。还是来看看效果吧,

【没加Caveman】

【加了Caveman】

离谱的是我抽了三次,加了Caveman的效果都不没有下滑,反而比裸Prompt好了不止一点。

画面不偏移了,稳定度也上来了,代码整体的解析也是稳了很多。

02、03|Codex Token Skills和Headroom

这两个skill踩的是同一个坑,能省多少,取决于输入里有多少可以省。

我给Codex Token Skills出的题,是按照一份详细设计稿实现深色 Hero。

写的非常详细啊,背景色,模糊元素偏移215px宽801px高384px模糊77.5px,标题Inter中等76px字距负2px,副标题Manrope 18px行高26最大宽613px,按钮背景。规格密密麻麻写了一大段。

这种任务其实很难减少输入Token,因为每个数字都是实现要求,必须读完,少看一条,最后的页面就可能不一样。

实际数据也说明了这一点,没用之前,输入是42.1kToken,输出是12.8k Token,花费约 0.56 美元,API 用时 1 分 15 秒。

用了之后,输入增加到46.7k Token(因为skill本身也占token),输出降到了4.4k Token,花费降到约0.365 美元,API 用时也缩短到 29 秒。最终生成的代码从 356 行增加到 387 行,页面效果却几乎看不出差别。=


左边没加Codex Token Skills右边加了

我是看不出区别,Skill用了缓存保了要实现的页面规则也出来了,爽翻了简直。

安装的时候还有个小坑顺带提一句。这个仓库的memory Skill里写死了作者自己的Windows路径,C盘用户名都还在,要改成本机路径才能跑。

那Headroom的作用很像是帮模型整理资料。

如果交给模型的内容本来就很短、很干净,它几乎帮不上忙。我们用几个简单任务测试时,三次全部判定no-op(不启动),0Token压缩,因为里面本来就没有多少可以删掉的内容。

但当输入非常长,而且夹杂着大量日志、重复代码和工具返回结果时,它的效果就比较明显了。

第一个任务是让模型检查一份很长的 CSS 文件。原始材料大约有1.65万 Token,其中包含报错信息、重复内容和工具输出。Headroom 整理之后,只剩下约 8500 Token,减少了大约 48.5%。


第二个任务是让模型阅读大量日志,找出最值得修复的三个问题。

没有使用 Headroom 时,两次测试的输入分别是16,533 Token,模型输出分别用了4,000和2,309Token。第一次还碰到了输出上限,回答被中途截断。

用了Headroom 后,输入分别降到8,505 和 8,505 Token,减少了约 48.6%。模型输出只用了1,536 和1,606 Token,两次都完整写出了三个问题、对应证据和修复方案。

也就是说,Headroom不只是把输入压短了。它还减少了模型在重复日志和无关信息中找重点的消耗,模型可以用更少的输出 Token,给出更完整更集中的答案。

04|Ponytail马尾辫

它的思路是拦住模型那种「我可以顺手给你搭一个完整系统」的冲动。动手之前一层层往下问,标准库能不能做,平台原生能力能不能做,已装依赖能不能做,一行代码能不能做。都不行才开始造新东西。

我给它配的是做一个卡通激光眼,一道要调MediaPipe做人脸关键点,再把激光束画出来的题。

不装Skill,675行21404个字符,装了Ponytail,488行14916个字符。行少27.7%,字符少30.3%。CSS规则从69条降到35条,砍了一半。函数从22个降到12个,砍了45%。script标签从2个变成1个,注释从70处降到31处。


规则少了一半,但功能一个没少。

我自己做UI的时候就经常踩这个坑。明明只要一个小交互,最后多出一套状态管理,一组重复组件,几个用不上的工具函数。Ponytail就像一个会在你按回车之前问一句「真的需要吗」的同事。

不过他们项目自己说的能省92%到94%的token得单独拎出来说一下。那两个数对应的是代码行数,不是平均Token降幅,这怎么不算数字的艺术呢。

05|Codex Token Saver

六个里省得最猛的那个。


它的规则包括改代码前不读文件,非用户要求不测试不构建,默认零验证,失败只重试一次。

作者宣称能省40%到70%,不过跟前面那个Codex Token Skills一样,仓库里也没有任何公开基准。

我给它的题目是TOONHUB,一个3D角色轮播UI,要求四个角色卡片式切换展示。不装Skill的话,509行18695个字符,装了token-saver,61行5396个字符。行少88%,字符少71.1%。

我第一反应是它偷工减料了,逐条去对功能。但是功能一个都没少。只看压缩率,这确实是所有测试中最夸张的一组。但把四张角色卡片放大后,问题就出现了。

【没加Token Saver】

【加了Token Saver】

不装Skill那版,画了4个SVG,四个角色造型各不相同。token-saver那版,只写了1个SVG模板,然后用JS循环四次,换四种颜色。

所以这次测试更准确的结论是,Token Saver的代码压缩率确实高,基本交互也保留了,但它把原本应该独立设计的四个角色过度合并成了一套模板,牺牲了角色差异和设计质量。

06|Graphify

是反转最多的一个。

它太容易被误读了。71.5倍的省token是来自一个旧版项目在一个特定大型混合语料上的每次查询对照,不是总token账单减少71.5倍。我给它造了一个79文件的TypeScript仓库,src下面有auth,billing,api,ui,db,utils,再加四篇文档,里面埋了真实的跨文件调用链。然后出了20个必须跨文件才能回答的问题。


一组是每次重读相关文件,一组是先建索引之后只查索引。20个问题跑完,单查询输入平均从583.5降到163.8。3.56倍。

所以说,不是70倍,也不是10倍,是3.56倍。

Graphify的逻辑其实就是先花一笔Token建图,建索引,再靠后面的查询慢慢把成本摊回来。

单看查询阶段确实省很多,因为不用每次重新扫整个仓库。但问题是,建图本身也很贵。

这次 79 个文件全读一遍,大约就花了3万Token。问了十几个问题以后,不建图总共用了28,586 Token。建图那组加上索引成本,反而用了42,281 Token,多了 48%。

按这个降幅推,大概要在同一份索引上问到 36 次左右才开始回本。

所以一次性项目大概率划算,只有长期,复杂,而且会被反复查询的仓库,前面的建图项目大了成本才摊得回来。

最后的最后,

前面六个Skill各做各的题,有的确实省了,有的反而加了。可题目不一样,难度不一样,天然对不同方向的Skill有利有弊,横向没法比。

所以我换了一种打法,开目标模式,把六个Skill全拉到同一道题上重新跑。这次的题目是电影感FIFA世界杯网站,要求做一个有电影质感的世界杯落地页,48支球队104场比赛,带倒计时。

模型统一DeepSeek V4 Flash开thinking,输出上限64K。评分交给GPT-5.6-sol和Claude Opus 4.8各来一遍,七个版本匿名映射成A到G,评审只看需求原文加截图加HTML,看不到哪个是哪个。六个维度加起来100分,视觉25,需求符合25,交互20,稳健15,响应式和可访问性10,实现效率5。

效果是这样的,



六个号称省Token的项目,一个都便宜。


Headroom是平的,因为这道需求只有280个Token,压不动。剩下五个全在加钱,最少的加33.5%,最多的加222.8%。

六个的质量分数,全部持平或者更高,一个降的都没有。

分最高的是Graphify,93.5分。不装Skill那版是一张平的深色页,标题加倒计时加两个按钮。Graphify那版直接把整个球场看台做成背景,ONE WORLD ONE GAME ONE DESTINY三行大字压上去,底下铺了48队104场16城1座奖杯的数据条。Codex Token Saver那版走的是另一个方向,左边文案右边奖杯,衬线大标题WHERE LEGENDS RISE,底部一条跑马灯。81K的HTML,全场最大。

它俩都没有在省token的,反而是猛加。

到这我就有点想不通了,钱到底加在哪了。页面是更好看了,但也没多出这么多代码啊。

然后我去翻了使用额度里那个叫reasoning_tokens的字段,可以理解成模型的思考过程。

不装Skill那版,模型想了12420个Token,写出来18098个。装了Codex Token Skills那版,模型想了36217个,写出来18728个。它多花的24717个Token里,有23797个是thinking,可见的输出只多了630个。

96%的新增开销,是模型多想了一会。交到你手上的东西,几乎一个字没多。


这就是这批Skill尴尬的地方。

写的每一条规则,模型都得先读进去,理解,然后在动笔之前多想一轮,这条规则跟我要做的事怎么协调。规则越多越严,它想得越久。

而thinking在这道题上,不装Skill就已经占了40.3%,装上Codex Token Skills之后涨到65.2%。

三分之二。。。

辛辛苦苦算的那几笔账,输出,代码,上下文,缓存,管的全是模型说出来的那部分。真正在烧钱的,是它没说出来的思考部分。

前面单独跑的时候,这个问题不明显。一开目标模式,Skill的规则再叠上来,它在动笔之前就得多想一轮又一轮,这条约束跟质量目标怎么协调,那条规则和创意方向打不打架。thinking比例从四成拉到六成以上,前面省下来的那点输出和输入,就已经全被思考的开销吃干净了。

所以跑完这一轮我最大的感受是,

可能从一开始就把这些skills的定位搞错了。

它们不是省钱工具,说到底也还是是约束工具。

简单任务里,约束确实能砍掉废话、重复和多余代码,实打实省钱,数据摆在那。

但只要你的场景稍微复杂一点,只要你对质量有要求,约束就反过来变成额外的思考负担,账单也跟着涨。

所以,回到最开始那个问题,哪个值得装。

这取决于我们拿它去做什么。

日常任务,规则明确,对质量没有竞争性要求,Ponytail我会留着,Headroom我也留着。

其他的等我晚点用Claude合并搓一个新的质量无损Skill出来吧。

许愿一把DeepSeek晚点再涨价,

等我马上再去烧一轮额度。

话说为了省token而烧更多的token,

这算左右脑互搏吗?

@ 作者 / 卡尔

最后,感谢你看到这里如果喜欢这篇文章,不妨顺手给我们点赞|在看|转发|评论

如果想要第一时间收到推送,不妨给我个星标

如果你有更有趣的玩法,欢迎在评论区聊聊

更多的内容正在不断填坑中……


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
氡气诱发肺癌已成定论,居家两处易蓄积,看完尽早做好排查防护

氡气诱发肺癌已成定论,居家两处易蓄积,看完尽早做好排查防护

健康科普365
2026-08-12 18:55:05
女子谈释永信过往,她们姐妹住少林寺3天2夜,争着往释永信房间跑

女子谈释永信过往,她们姐妹住少林寺3天2夜,争着往释永信房间跑

江山挥笔
2025-07-29 16:50:59
连姆·尼森2024年犯罪惊悚片Netflix美国冲第3,硬汉杀手欲退隐却遭IRA逼杀

连姆·尼森2024年犯罪惊悚片Netflix美国冲第3,硬汉杀手欲退隐却遭IRA逼杀

渡川5
2026-08-13 03:38:34
ESPN:阿森纳不想将马丁内利出售给英超对手;球员本人不想去土超

ESPN:阿森纳不想将马丁内利出售给英超对手;球员本人不想去土超

懂球帝
2026-08-13 01:11:09
拉夫罗夫:莫斯科将把所有历史上的俄罗斯土地归还其合法家园

拉夫罗夫:莫斯科将把所有历史上的俄罗斯土地归还其合法家园

番茄说史聊
2026-02-22 14:07:52
“这环境,咋敢生孩子?”女孩因充电器被碰掉绝食,穷人家的公主

“这环境,咋敢生孩子?”女孩因充电器被碰掉绝食,穷人家的公主

妍妍教育日记
2026-05-09 13:31:49
勇士一夜4消息!库里将续约,训练营合同追本西,又看上3大新援

勇士一夜4消息!库里将续约,训练营合同追本西,又看上3大新援

锅子篮球
2026-08-12 14:56:54
活久见!93年辛辛那提大师赛后首次3位美国球员晋级大师赛半决赛

活久见!93年辛辛那提大师赛后首次3位美国球员晋级大师赛半决赛

体谈
2026-08-12 16:23:00
153人死亡!五角大楼首次公开承认

153人死亡!五角大楼首次公开承认

环球时报国际
2026-08-12 15:15:41
37岁窦骁高调官宣喜讯,“豪门赘婿”身份彻底成过去式

37岁窦骁高调官宣喜讯,“豪门赘婿”身份彻底成过去式

In风尚
2026-06-10 06:04:08
清华大学深夜通告:暂停校园参观活动

清华大学深夜通告:暂停校园参观活动

极目新闻
2026-08-12 10:53:26
细看程梦圆失踪最不对劲的事不是她进山的路

细看程梦圆失踪最不对劲的事不是她进山的路

小鹿姐姐情感说
2026-08-13 02:58:04
紫石英号事件直观暴露出实力差距:华野麾下所有炮兵的火力总量相加,竟然比不过英军一艘重型巡洋舰的火力

紫石英号事件直观暴露出实力差距:华野麾下所有炮兵的火力总量相加,竟然比不过英军一艘重型巡洋舰的火力

唠叨说历史
2026-08-04 14:32:49
DeepSeek和豆包用了半年,我果断卸载了其中一个,原因太真实!

DeepSeek和豆包用了半年,我果断卸载了其中一个,原因太真实!

侃故事的阿庆
2026-08-11 06:56:01
梦鸽李天一赴美不归?看到85岁李双江“现状”,原来杨洪基没说谎

梦鸽李天一赴美不归?看到85岁李双江“现状”,原来杨洪基没说谎

阿纂看事
2024-11-05 11:54:58
宫鲁鸣该行动了!世界杯想突围,必须舍弃张曼曼召回郑薇王牌控卫

宫鲁鸣该行动了!世界杯想突围,必须舍弃张曼曼召回郑薇王牌控卫

林子说事
2026-08-12 06:11:55
中国女排淘汰赛对手揭晓!U17世锦赛16强确定,巴西赢下荣誉之战

中国女排淘汰赛对手揭晓!U17世锦赛16强确定,巴西赢下荣誉之战

排球黄金眼
2026-08-12 11:12:02
资本家的丑孩子收手吧!12岁提名百花奖?别再祸害观众眼睛了

资本家的丑孩子收手吧!12岁提名百花奖?别再祸害观众眼睛了

历史点行
2026-08-11 20:29:00
乔治克鲁尼罕见携8岁双胞胎亮相慈善晚宴,全家乘船出席

乔治克鲁尼罕见携8岁双胞胎亮相慈善晚宴,全家乘船出席

生活观察员啊
2026-08-13 01:54:25
可算是来人了!国米购买新边翼卫HWG,26岁英格兰国脚加入

可算是来人了!国米购买新边翼卫HWG,26岁英格兰国脚加入

里芃芃体育
2026-08-13 04:40:04
2026-08-13 05:32:49
卡尔的AI沃茨 incentive-icons
卡尔的AI沃茨
前大厂算法工程师,3家科技公司技术总监|致力打造最系统的Al学习体系,让1万人通过Al提高生产力
311文章数 143关注度
往期回顾 全部

科技要闻

Manus第二季,浪子回头

头条要闻

冲上热搜:银行能办结婚证了

头条要闻

冲上热搜:银行能办结婚证了

体育要闻

杜兰特,所谓的“联盟小王”

娱乐要闻

老戏骨杨昆两夺金鹰奖,因物业费被告

财经要闻

华尔街把AI算力炒成下一个房地产?

汽车要闻

全系600km续航/空间表现出色 奇瑞风云T7预售10.99万起

态度原创

房产
时尚
本地
数码
军事航空

房产要闻

价格登顶,断层领跑!澄迈这家楼盘,凭什么?

炎炎盛夏,正好Sportique一下!

本地新闻

黄州一夜,苏轼写给普通人的月光

数码要闻

Google推出Pixel Watch 5智能手表

军事要闻

通过“毕业大考” 湖北舰“持证上岗”

无障碍浏览 进入关怀版