网易首页 > 网易号 > 正文 申请入驻

LLM Embedding Model算力瓶颈从Query侧移走,LightRetriever来了

0
分享至

近年来,大模型文本检索(LLM-based Text Retrieval)技术发展迅猛,SOTA 的 LLM Embedding Model 参数量普遍在 7B 以上,相关性搜索性能提升的同时,部署成本也大幅增长

众所周知,LLM Embedding Model 是一种对称式双塔结构,Query 和 Doc 侧常共享同一个完整的 LLM。但一个长期被忽视的问题是:线上推理中,查询端(Query)真的需要和文档端(Document)一样 “重” 的大模型吗?在我们最新的研究论文 LightRetriever 中,文章给出了一个明确、激进、但被大量实验证实可行的答案:不需要

LightRetriever 设计了一种极致非对称式结构的 LLM Embedding Model—— Doc 侧使用完整 LLM 建模,但Query 侧最多仅用一层 Embedding Lookup。极致化降低了 Query 侧推理负担,也能做好大模型文本搜索。对比 Query-Doc 均用完整 LLM 的标准设计,LightRetriever 让 Query 侧的推理速度提升了千倍以上、端到端 QPS 提升 10 倍,同时 BeIR、CMTEB Retreival 等测试集上的中英文检索性能也能维持 95% 左右

文章由中科院信工所 & 澜舟科技共同完成,已接收于国际计算机顶级会议 ICLR 2026。ICLR(International Conference on Learning Representations)是机器学习与表示学习领域的国际顶级会议之一,与 NeurIPS、ICML 并列为人工智能方向最具影响力的学术会议。本次 ICLR 2026 共有接近 19000 篇有效投稿,接收率约为 28%。

  • 论文标题:LightRetriever: A LLM-based Text Retrieval Architecture with Extremely Faster Query Inference
  • 论文链接:https://arxiv.org/abs/2505.12260

LightRetriever:极致非对称的 LLM Embedding Model

LightRetriever 的核心思想非常明确:将深度建模的主要计算负担彻底转移到 Doc 侧,Query 侧只保留必要、可缓存的表征能力。LightRetriever 为稠密稀疏检索两大检索范式,分别设计了极致非对称的建模方法。

图。在稠密 / 稀疏检索中,对称式 LLM Embedding Model 使用了 1) 标准的 Full-sized Query Inference,查询侧推理负担很重;2) LightRetriever 大幅降低了查询推理成本,查询侧负载降低至不超过一层 Embedding Layer Lookup。

稠密检索(Dense Retreival)训练中,Doc 侧保持建模方式不变,LightRetriever 词袋化了 Query 侧建模:完整的 LLM 接收 “指令 + 单个 Query Token” 作为输入,先建模 Token Embedding,再求平均获取 Query 句向量,并通过对比学习获得 Prompted Token Embedding。

不同之处在于,这些 Token Embedding 在训练完成后,可以被整体缓存为一个词表级 Embedding 矩阵。在线推理时,Query 句向量的推理仅需一次简单的 Token Embedding 查表 + 求均值,不再涉及任何 LLM 推理。由于 Query 侧在训练阶段仍需要完整 LLM 建模,稠密向量训练遵循 “训练全量 + 推理轻量” 的思想。后面的消融实验证明,“训练全量” 这种配置不可忽略。

图. LightRetriever 的稠密检索设计遵守 “训练全量 + 推理轻量” 的思想,通过词袋化 Query 侧建模,打破上下文依赖,使得 Query 侧向量推理具备可缓存(Cacheable)的特性。仅需一次缓存,就可以无 LLM 部署 Query 推理服务。

稀疏检索(Sparse Retrieval)中,LightRetriever 将 Query 侧进一步被简化为词表空间 T 的 “Token ID -> 个数” 的词频映射,完全移除了可学习的模型参数。

同样通过端到端对比学习,通过 Doc 侧的 LLM,学习类 SPLADE 方法的 TF-based (Term Frequency-based)稀疏向量。

图. LightRetriever 的稀疏检索设计更加极致,Query 侧仅依靠词袋化的统计方法建模词频特征,来实现无 LLM 高效化线上推理。

极端轻量化的查询,并没有带来灾难性的性能代价

直觉上,移除 Query 侧的深度上下文建模会显著损害检索效果。然而,大规模实验结果给出了一个出乎意料的结论:

在 BeIR(英文)与 CMTEB-Retrieval(中文)等多任务文本检索基准上,相对完整的对称式 LLM Embedding,LightRetriever 的 nDCG@10 排序指标只下降1–5 pp,平均性能保持率约为95%。更重要的是,该方法的性能水平大幅超过传统稀疏方法(BM25、SPLADE)以及多种轻量化或蒸馏检索模型,并逼近了类似开源训练语料的配置下,LLM2Vec、E5-Mistral 等经典的 LLM Embedding 方法。

这表明:在绝大多数相关性导向的检索任务中,Query 侧并不需要完整的深度 Token 交互,也能够匹配 Doc 侧所学习到的语义结构。

表. BeIR / CMTEB-Retrieval 主实验结果,包含经典 Embedding Model Baseline、对称式 Full LLM Retriever 与 LightRetriever 的检索效果。

文章对比了 LightRetriever 在不同任务中的细粒度性能表现。以 BeIR 为例,LightRetriever 在大多数常规的相关性检索任务中性能表现十分优异,是全对称式结构的 93% 以上;在 Domain-specific QA、Entity Retrieval、Citation Prediction 等更具挑战性的 OOD 任务中,性能维持在全对称式结构的 87%~89%。虽然相对性能略有下降,这些任务性能的绝对数值仍然具备较强的竞争力。

表。在 BeIR 的不同任务中,LightRetriever 的性能表现及相对变化(Retention)。

查询服务速度大幅提升

LightRetriever 的 Query 轻量化设计,为查询推理效率带来了数量级的提升

在 MSMARCO 检索场景下对 64k 查询进行检索,完整的 Llama-8B 查询编码需要超过100 秒;而 LightRetriever 的查询编码时间仅为0.04 秒,对应超过 1000×的编码加速。即便考虑 Faiss 与 Lucene 的检索时间,端到端吞吐仍然获得了10× 以上的 QPS 提升。文章还尝试了一个经典的 Transformers Layer 裁剪 Baseline:在 Query 侧只用 Llama-8b 的第一层 Transformers Layer 用于训练和推理。然而,这个设置的检索性能和 QPS 均不如 LightRetriever,因为训练时 Query 侧没有完整的 LLM 建模。这证明了文章中 “训练全量 + 推理轻量” 的设计的合理性。

表。查询编码时间 / 端到端 QPS 对比

为什么这种 “训练全量 + 推理轻量” 是必要的,而不是偶然有效?

在 LightRetriever 的稠密检索中,Query 侧在训练时使用全量(Full)建模、推理时转化为 Embedding Layer(Emb)高效化推理。为了验证这种设计的合理性,文章进行了以下两组消融实验:

A1) Doc 侧在推理时也使用 Embedding Layer。

A2) Query 侧在训练时直接用 Embedding Layer。

两者均会引起性能的大幅下降。这说明:在大模型文本检索中,移除深度建模并非偶然设计。

消融实验一(A1)证明了:Doc 侧始终需要完整建模,而 Query 侧可通过词袋化方法做到近似建模。

消融实验二(A1)证明了:LightRetriever 的关键不在于 “减少建模”,而在于将建模负载卸载至不同阶段—— 在训练阶段与 Doc 侧充分建模,在推理阶段最大化复用可缓存的 Query 词向量,即 “训练全量 + 推理轻量”。

从这一角度看,LightRetriever 并不是一次针对模型结构的微调,而是对 LLM 双塔模型计算范式的重新审视。

表。对称性消融实验。A1) Doc 侧推理时也进行了词袋轻量化;A2) Query 侧训练时直接使用了 Embedding 词袋。两者效果均显著下降。

结语:当 Query 侧部署不再是负担,LLM 检索才真正具备可扩展性

LightRetriever 表明,高质量的 LLM Embedding Model 并不必然意味着高昂的在线推理成本。通过明确区分 Query 与 Doc 在检索流程中的角色,并有意识地打破对称建模这一长期默认的设计假设,检索系统可以在维持效果的前提下,获得数量级的效率提升。

对于面向真实应用场景的检索系统、RAG 框架与在线搜索服务而言,这种查询轻量化的建模思路,或许比单纯追求更大的模型规模更具应用价值。

作者简介

文章第一作者为中国科学院信息工程研究所博士研究生马广远,研究方向为大模型信息检索,导师是虎嵩林研究员。本文在微软亚研院前副院长、现澜舟科技 CEO 周明博士和虎嵩林研究员的共同指导下完成。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
iPhone Neo曝光:4599元配A20芯片,安卓迎来最强对手

iPhone Neo曝光:4599元配A20芯片,安卓迎来最强对手

小柱解说游戏
2026-10-10 00:48:13
创造历史!李昊炎巴萨U15首秀就破门,替补登场身披17号,中国加盟拉玛西亚第一人!

创造历史!李昊炎巴萨U15首秀就破门,替补登场身披17号,中国加盟拉玛西亚第一人!

绿茵舞着
2026-10-10 21:01:53
10月7日三周年——暴力口号让支持者却步,欧洲巴勒斯坦支持者集会人数大幅减少

10月7日三周年——暴力口号让支持者却步,欧洲巴勒斯坦支持者集会人数大幅减少

老王说正义
2026-10-10 09:59:28
提及中国,蒋家人一句话,蒋万安应该听进去,非常不简单

提及中国,蒋家人一句话,蒋万安应该听进去,非常不简单

DS北风
2026-10-11 09:02:10
最煎熬的不是失业丢工作,而是社保年限从15年涨到20年

最煎熬的不是失业丢工作,而是社保年限从15年涨到20年

职场资深秘书
2026-10-11 09:18:25
戴兵大使:中方从未要求韩国在中美之间选边站队,希望韩方基于自身根本利益并行不悖发展对华对美关系

戴兵大使:中方从未要求韩国在中美之间选边站队,希望韩方基于自身根本利益并行不悖发展对华对美关系

政知新媒体
2026-10-10 23:47:19
一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

怪味历史连连看
2026-09-08 01:55:32
手贱是种怎样的体验?她永远也理解不了她的儿子为什么会这么蠢!

手贱是种怎样的体验?她永远也理解不了她的儿子为什么会这么蠢!

夜深爱杂谈
2026-10-10 20:09:02
周启豪赛后回答记者采访,猛夸松岛辉空,并称向他学习

周启豪赛后回答记者采访,猛夸松岛辉空,并称向他学习

林子说事
2026-10-10 14:39:19
真相大白!林诗栋现身北京某医院,网友曝更多细节,疑似伤病加重

真相大白!林诗栋现身北京某医院,网友曝更多细节,疑似伤病加重

十点街球体育
2026-10-09 20:54:41
“这跟内衣有啥区别?”中学女儿的外出穿搭,让母亲绷不住了

“这跟内衣有啥区别?”中学女儿的外出穿搭,让母亲绷不住了

世界圈
2026-09-22 15:46:08
20美元的宜家数字钟,拆开后发现一块LED点阵屏

20美元的宜家数字钟,拆开后发现一块LED点阵屏

有态度网友ytd2993
2026-10-10 17:27:36
创新药要起飞,重磅利好!国产抗癌新药横空出世,板块迎催化窗口

创新药要起飞,重磅利好!国产抗癌新药横空出世,板块迎催化窗口

慧眼看世界哈哈
2026-10-11 08:42:10
现场直击|沙特首都国际机场传出爆炸声 已无航班起降

现场直击|沙特首都国际机场传出爆炸声 已无航班起降

新华社
2026-10-11 01:24:08
环境真的能改变人的外貌吗?网友:广东是真不养人

环境真的能改变人的外貌吗?网友:广东是真不养人

带你感受人间冷暖
2026-10-08 00:05:18
医生提醒:西红柿炒鸡蛋,尽量不要放“此物”,可能多数人做错了

医生提醒:西红柿炒鸡蛋,尽量不要放“此物”,可能多数人做错了

芹姐说生活
2026-10-09 22:43:06
未婚妻和别人开房百次,男子想退婚,未婚妻:给我100万分手费,赔本的买卖不做

未婚妻和别人开房百次,男子想退婚,未婚妻:给我100万分手费,赔本的买卖不做

汉史趣闻
2026-10-10 10:33:00
人社部:全面推进“退休预服务”,网友:最怕材料不全来回补

人社部:全面推进“退休预服务”,网友:最怕材料不全来回补

东方豪侠
2026-10-11 09:14:14
普京下了死命令,他清楚:中俄关系再好,也必须为俄罗斯未来考虑

普京下了死命令,他清楚:中俄关系再好,也必须为俄罗斯未来考虑

陌上桃花开的
2026-10-10 20:54:56
38岁大龄剩女相亲10次被拒,怒骂剩男:我月薪4万,你凭什么不娶

38岁大龄剩女相亲10次被拒,怒骂剩男:我月薪4万,你凭什么不娶

广西秦胖胖
2026-10-10 08:57:08
2026-10-11 10:04:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14170文章数 142748关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

牛弹琴:特朗普发出最后通牒 泽连斯基的至暗时刻来了

头条要闻

牛弹琴:特朗普发出最后通牒 泽连斯基的至暗时刻来了

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

梅艳芳63岁冥诞骨灰被盗,亲哥从不知情

财经要闻

黄仁勋长女完婚,万亿帝国如何传承?

汽车要闻

千匹马力+三把锁/顶配能浮水 银河战舰700限时焕新价16.98万起

态度原创

教育
家居
手机
数码
军事航空

教育要闻

看起来这道题很复杂,实际其中有很多的奥妙

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

安卓首款、全球第二款阔直板手机将至:酷派新机首曝,价格干到“999定位千元档”

数码要闻

苹果新一代Apple TV 4K有望于10月13日正式亮相

军事要闻

美乌将举行新一轮会谈

无障碍浏览 进入关怀版