大模型推理成本高,很大一块花在思维链上。这篇论文给出一条不训练的新路:把可复用的推理从生成阶段搬进提示词。
记忆增强压缩是核心方法。它先把已经解过的示例蒸馏成可复用推理记忆,查询时按需检索,再注入提示词。
![]()
这样做的直接效果,是让一部分计算从自回归解码转移到更并行的预填充阶段。生成阶段少算一点,成本就降一点。
为什么值得关注
传统降本思路往往要微调或重新训练,门槛不低。这个方法不需要训练,靠的是对已有推理结果的压缩和复用。
对需要频繁调用大模型做相似任务的场景,这种把“想过的答案”存下来再用的思路,可能比一味堆算力更实际。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.