每一次API调用都在烧钱,而烧得最狠的往往不是模型本身,是你写的那段啰嗦提示词。臃肿的prompt会悄悄吃掉预算,还会拉低回答质量。所谓token压缩,就是用更少的token传递同样的意图;提示词优化,则是把这份意图组织得让模型读得准、答得快。
下面这五个技巧可以直接上手,每一个都附带了背后的逻辑和可运行的代码示例。
![]()
一、把啰嗦指令换成结构化约束
长篇大论、像跟人聊天一样的系统提示词,写起来顺手,成本却高得多。解决办法是从叙述式指令转向声明式约束,用模型容易解析的类schema格式来表达。
比如原本要写:请确保回复时始终使用项目符号,答案控制在100词以内,不要在开头加任何铺垫,也不要在结尾加署名。压缩之后变成一行:格式:项目符号 | 上限:100词 | 省略:铺垫、署名。
这一行把36个token替换成了大约14个。放到成千上万次API调用里,省下来的量会迅速累积。具体形式可以用竖线分隔的键值对、YAML风格约束,或者JSON schema片段,取决于你在用哪个模型家族。
二、少样本示例要精,不要多
少样本提示——在实际请求之前先给几组输入输出示例——能显著提升输出格式的一致性。大多数人犯的错是示例给太多。相关研究和学术基准反复显示,对多数分类和生成任务来说,超过三到五个示例之后收益就开始递减。
一个精简的三示例情感标注提示词长这样:系统提示为“标注情感。只回复一个词:正面、负面或中性”,然后给出三组示例——输入“按时发货,包装完好”对应正面,输入“开箱就是坏的”对应负面,输入“它到了”对应中性。
三个示例就足以确立模式。再加十个很少能提升准确率,反而常常引入互相矛盾的信息,把模型绕晕。建议先审计你现有的少样本提示词,在一、三、五这三个示例数量上分别做基准测试,再决定要不要扩大规模。
三、长文档用动态上下文裁剪
把长文档塞进提示词时——会议记录、法律文本、知识库文章——你几乎总是在为模型根本不需要的token付费。动态上下文裁剪只取相关段落,而不是整篇文档。
实现方式是用句向量做余弦相似度检索:把查询和各个段落分别编码成向量,算出相似度分数,取分数最高的前三个段落返回,然后把过滤后的段落列表传给模型,而不是原始文档。
对于一个10000个token的知识库,如果真正相关的只有800个token,光这一项技术就能把上下文成本砍掉90%以上。
四、用提示词缓存复用重复前缀
很多应用在每一次用户请求里都重复同样的系统提示词:同样的人设定义、同样的工具描述、同样的策略约束。每次都重新发送这些token完全没有必要。
现在一些推理服务商已经支持在服务端存储并复用静态提示词前缀,缓存命中的token按标准输入价格的一小部分计费。做法是把提示词结构安排成稳定内容在前、动态内容在后:
- 系统提示词——静态,800个token,首次调用后被缓存
- 检索到的上下文——半静态,400个token,可能被缓存
- 用户消息——动态,50个token,永远新鲜
动手之前先查一下你所用服务商的缓存文档。有的缓存机制要求被缓存的前缀超过一个最低token阈值,并且要在规定的时间窗口内命中,才会真正生效。
五、用草稿分离压缩思维链推理
思维链提示能提升模型在复杂任务上的推理表现,但推理过程本身——有时长达数百个token——常常原封不动地出现在API响应里,哪怕你只需要最终答案。这会迅速抬高输出token成本。
解决办法是用结构化输出标记,把推理草稿和最终答案分开。提示词里要求模型先在指定标签内一步步解题,然后只在另一个标签内给出最终答案。应用层解析后丢弃思考块,只为推理token付费,但只把答案内容存储并返回给终端用户。
对于原生支持扩展思考或推理模式的API,推理token可能按完全不同的费率计费,并且可以从响应体中抑制掉。
配套工具
落地这些技巧时,有几个工具能帮上忙:LangChain提供token计数工具和检索增强生成管线,适合做动态上下文裁剪;LiteLLM提供跨服务商的统一接口,内置成本日志,方便追踪token用量;Sentence Transformers提供高效的嵌入模型,用于语义段落检索;tiktoken则是OpenAI的分词工具。
这五个技巧的共同点在于,它们都不需要换模型、不需要加预算,只需要重新组织你已经写下的那些字。token压缩不是抠门,是把钱花在模型真正需要读的内容上。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.