在Amazon Bedrock上运行大规模检索增强生成(RAG)应用时,每次调用发送给基础模型(FM)的输入token往往是成本的重要组成部分。查询感知压缩(query-aware compression)提供了一种减少到达模型的token数量的方法。
RAG检索的固有矛盾
![]()
RAG检索通常以高召回率为目标,返回大量潜在相关的文本块,让主模型在推理时有充分的源材料可用。这种设计让开发者确信在推理时能获取到正确的信息。但随着工作负载扩展,开发者开始寻找优化成本与性能平衡的方法——在保持答案质量的同时,减少主模型处理的输入token数量。
Amazon Bedrock的开放、可组合架构支持自定义检索后处理步骤,可以精炼最终到达主模型的内容。本文描述一种检索后定制模式,在保持答案质量的同时实现显著的输入token缩减,从而节省成本。该模式兼容Amazon Bedrock上的RAG检索器,包括Amazon Bedrock Knowledge Bases。
核心思路:小模型先行过滤
该模式的工作流程是:在检索之后、最终答案调用之前,使用Amazon Bedrock上一个较小、成本较低的模型,根据用户查询过滤检索到的文本块。主模型随后接收过滤后的上下文并生成答案。
具体来说,一个小模型读取检索到的文本块和查询,只输出与问题相关的逐字片段。本文使用Claude Haiku作为压缩模型,但该模式也适用于Amazon Bedrock上同一模型家族内的其他小模型/主模型组合。压缩调用和主模型的答案调用都在同一个AWS Lambda函数内运行。
上游,检索器嵌入查询并返回top-k文本块。Amazon Bedrock Knowledge Base——由Amazon OpenSearch Serverless支持的全托管RAG能力——就是这样的检索器之一。Lambda函数接收这些文本块作为输入,并返回压缩后的上下文。
成本节省的量化基础
检索到的上下文规模随top-k和块大小而变化:在典型块大小下检索5-20个文本块,会使许多技术文档和法律RAG工作负载的每次查询输入token达到数千个。减少每次查询的token数量可以带来可观的成本节省。
该模式还带来一个次要好处:移除不相关的上下文减少了幻觉(hallucination)的潜在空间。主模型只看到与查询相关的信息,降低了生成虚构内容的风险。
可叠加的优化能力
该模式可以叠加在Amazon Bedrock现有能力之上,实现复合成本节省:
- Prompt缓存:缓存重复使用的提示部分,减少重复token处理
- Amazon Bedrock Intelligent Prompt Routing:智能路由提示到最合适的模型
- Rerank API:在压缩前进一步优化文本块排序
这些能力与查询感知压缩模式结合,可以在多个层面减少token消耗。对于在Amazon Bedrock上运行大规模RAG工作负载的团队来说,这是一个值得评估的优化方向。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.