网易首页 > 网易号 > 正文 申请入驻

MoE路由拥有「记忆」:RMS-MoE用检索记忆协同实现更高效专家调度

0
分享至



机器之心发布

大模型越来越大,Mixture-of-Experts(MoE)已经成为扩展模型参数规模、降低单次计算成本的重要架构之一。但在真实的 Web-scale 系统中,MoE 路由机制仍然存在一个容易被忽视的问题:它往往是「无记忆」的。

对于搜索、问答、对话等高并发场景,大量输入并非完全独立,而是具有显著的语义重复性和结构相似性。传统 MoE 路由器每次都从当前输入出发,重新判断应该激活哪些专家。这意味着,即使模型此前已经在相似输入上找到过有效的专家组合,下一次遇到类似问题时,仍然可能重新探索一遍。

这种「短视」的路由方式会带来三个问题:一是重复计算,导致推理延迟和资源浪费;二是路由不稳定,输入稍有扰动就可能触发完全不同的专家集合;三是专家之间的协作关系难以沉淀,模型只是在选择单个专家,而没有显式复用历史上有效的「专家团队」。

针对这一问题,来自马上消费金融、南京航空航天大学、阿里巴巴等机构的研究团队提出了RMS-MoE(Retrieval-Memory Synergy Mixture-of-Experts)。该工作将 MoE 路由从一次性的分类决策,重新定义为一个「检索 — 记忆 — 融合」的过程:模型不再只依赖当前 router 的即时判断,而是会从历史记忆中检索相似输入曾经激活过的高效专家组合,并与当前路由结果动态融合。



  • 论文标题:Rethinking MoE with Retrieval-Memory Synergy: Towards Efficient Expert Coordination
  • 会议:The ACM Web Conference 2026(WWW 2026)
  • 作者:Wanjie Tao, Qun Dai, Yantong Lv, Quan Lu, Ning Jiang, Zulong Chen
  • 机构:马上消费金融、南京航空航天大学、阿里巴巴
  • 论文链接:https://dl.acm.org/doi/epdf/10.1145/3774904.3792922

MoE 路由为什么需要「记忆」?

MoE 的优势在于稀疏激活。给定一个输入,router 会从多个专家中选择少数几个参与计算,从而在保持模型容量的同时降低每次前向计算成本。

然而,当前主流 MoE 路由方式大多仍然遵循一种 stateless paradigm:每个输入独立处理,历史上相似输入的专家选择经验并不会被系统性利用。

这在离线 benchmark 中可能不明显,但在真实 Web 场景中会变得非常关键。例如,在搜索、开放域问答、智能客服和多轮对话中,用户请求往往存在大量语义重叠。同类问题、同类任务、同类表达会反复出现。如果系统每次都重新计算专家分配,就会造成明显的计算冗余。更重要的是,对于语义相近的输入,如果专家激活集合频繁波动,模型行为也会变得不稳定。

RMS-MoE 的出发点是:既然用户输入具有重复性,专家协作模式也应该可以被记住和复用。与传统 RAG 从外部知识库检索文本内容不同,RMS-MoE 检索的不是知识片段,而是模型内部的专家协作模式。换句话说,它做的是一种 architectural memory:让模型记住自己过去是如何调度专家的

RMS-MoE:

从「即时路由」到「检索增强路由」

RMS-MoE 的整体框架由三个核心模块构成:Co-Activation Memory(CAM)、Adaptive Fusion Module(AFM)和 Reinforcement-Guided Memory Update。CAM 用于存储和检索历史上有效的专家组合;AFM 用于动态融合记忆先验和当前 router 的实时判断;强化反馈式更新则用任务反馈持续维护记忆质量。

从流程上看,当一个新输入进入模型后,RMS-MoE 首先通过 Input Encoder 得到输入表示,同时标准 router 会生成一个实时专家激活结果。与此同时,CAM 会根据当前输入表示,从记忆库中检索最相似的历史样本,并取出这些样本对应的专家激活模式。随后,模型会根据检索相似度和历史效用信息,聚合得到一个 memory prior,也就是「历史上相似输入更可能适合哪些专家团队」。最后,AFM 会学习一个动态融合权重,将 memory prior 与实时 router 输出结合,得到最终专家激活结果。

这种设计带来的好处是:对于熟悉、重复、语义相近的输入,模型可以更多依赖历史上验证有效的专家组合;对于新颖或低相似度输入,模型仍然可以回退到实时 router,保持灵活性。



RMS-MoE 方法框架图

Co-Activation Memory:

记住的不是知识,而是「专家团队」

RMS-MoE 的关键模块是Co-Activation Memory。CAM 可以理解为一个动态 key-value memory。每条记忆包含两部分:key 是输入 embedding,value 是对应的专家激活模式以及相关元信息,例如历史 reward、最近使用情况等。

当新输入到来时,模型会用当前输入 embedding 去 CAM 中检索 top-K 个相似条目。每个条目不仅代表一个相似输入,还携带了该输入曾经激活过的专家组合。随后,RMS-MoE 会结合相似度和历史效用,对这些专家组合进行加权聚合,得到一个专家选择先验。

这里的核心思想是:专家之间的共同激活关系本身就是一种可复用的结构知识。传统 MoE router 往往独立评估每个专家是否应该被激活,而 RMS-MoE 更关注「哪些专家曾经一起有效工作」。这使得模型不只是选择专家,而是在复用专家团队的协作经验。

Adaptive Fusion:

既相信记忆,也保留实时判断

仅有记忆是不够的。如果模型过度依赖历史经验,就可能在遇到新任务、新表达或低频场景时产生错误迁移。因此,RMS-MoE 引入了Adaptive Fusion Module,用一个可学习的动态门控系数 β 来控制记忆先验和实时路由之间的平衡。

当当前输入与 CAM 中的历史样本高度相似时,β 会更大,模型更倾向于使用记忆检索得到的专家组合;当相似度较低时,β 会降低,模型则更多依赖当前 router 的即时判断。这使得 RMS-MoE 不会变成一个简单的缓存系统,而是一个能够根据输入熟悉程度自适应决策的路由框架。

简单来说,RMS-MoE 的路由逻辑可以概括为:熟悉的问题,优先复用历史上表现好的专家团队;陌生的问题,回退到当前 router,保持探索能力;模糊的问题,在记忆和实时判断之间动态折中。

强化反馈式更新:让记忆持续进化

为了避免 CAM 退化成静态缓存,RMS-MoE 还设计了reinforcement-guided memory update。在训练过程中,模型会根据任务反馈更新记忆条目的效用分数。论文中将负训练损失作为 reward 信号,并使用指数滑动平均更新历史 reward。

同时,CAM 还会记录条目的新近程度,并在容量受限时基于 utility-recency score 进行淘汰。也就是说,一个专家组合如果在历史上多次带来较好任务表现,它就会更容易被保留和再次检索;如果一个组合长期无效或过时,则会逐渐被削弱甚至移除。

此外,CAM 更新被设计为异步机制。模型不会在每次前向传播中同步修改索引,而是将更新操作缓冲后批量执行。这种设计避免了检索索引对梯度计算的干扰,也降低了在线更新带来的系统开销。

实验:

在 WebQA 和 MultiWOZ 上同时提升准确率、延迟和稳定性

论文主要在 WebQA 上进行评估。WebQA 包含 120 万个问答样本,并具有约 30% 的查询冗余,非常适合测试记忆增强路由在高重复 Web 场景中的效果。同时,研究团队还在 MultiWOZ 上验证了方法在多轮任务型对话中的泛化能力。

实验对比了多种强 MoE 基线,包括 Switch Transformer、Expert-Choice MoE、Hash-MoE、Soft-MoE 和 DeepSeekMoE。所有模型使用相同的 MoE 基础架构:32 个专家,hidden dimension 为 1024,每个 token 激活 top-4 专家。RMS-MoE 额外设置 CAM 容量为 10^5,检索 top-5 个记忆条目。实验在 8 张 NVIDIA A100 GPU 上运行,并报告 10 次运行的均值和标准差。

在 WebQA 上,RMS-MoE 取得了最优结果。相较于 DeepSeekMoE,RMS-MoE 的 F1 提升 2.7 个点,归一化延迟从 0.72× 降至 0.53×,约降低 26%。相较于 Switch Transformer,RMS-MoE 的端到端延迟几乎减半。在 MultiWOZ 上,RMS-MoE 也保持了类似趋势,实现了 2.5 个 BLEU 分数提升和 34% 的延迟降低。这说明该方法并不局限于单一问答任务,也能够迁移到多轮对话场景。



WebQA 主实验结果(Latency 归一化至 Switch Transformer)

消融实验:CAM 是性能提升的关键

为了分析各模块贡献,论文进一步进行了消融实验。结果显示,移除 CAM 后,模型 F1 从 82.5 降至 77.3,稳定性从 0.94 降至 0.85,性能退化最明显。这说明历史专家协作模式的检索与复用是 RMS-MoE 的核心收益来源。

移除 Adaptive Fusion 后,F1 降至 78.2,说明简单使用记忆并不足够,模型必须根据输入情况动态决定「相信记忆」还是「相信当前 router」。移除 reinforcement-guided update 后,F1 降至 79.8,稳定性也出现下降,说明记忆质量的持续维护同样重要。

敏感性分析进一步表明,RMS-MoE 对关键超参数较为稳健。CAM 容量在 10^5 附近达到较好效果,top-K 检索数量在 K=5 时形成较优的准确率 — 延迟平衡,而融合门控 β 最终稳定收敛到约 0.6,说明模型会在相当一部分决策中主动利用记忆先验。



WebQA 消融实验结果

为什么这项工作重要?

RMS-MoE 的意义不只是提出了一个新的 MoE 变体,更重要的是,它重新思考了 MoE 路由的本质。过去,MoE 路由通常被看作一个即时决策问题:给定当前 token,选择若干专家。RMS-MoE 则把它扩展为一个具有历史经验的动态过程:当前输入不仅由当前 router 决定,也可以参考过去相似输入中已经验证有效的专家协作模式。

这带来了三个层面的变化。第一,路由从「无状态」变成「有记忆」。模型能够复用历史上成功的专家组合,减少重复探索。第二,专家选择从「单专家打分」走向「专家团队复用」。RMS-MoE 显式建模共同激活模式,让专家协作关系成为可检索、可强化、可淘汰的结构。第三,检索增强不再只发生在内容层。传统 RAG 检索的是外部知识或文本片段,而 RMS-MoE 检索的是模型内部架构行为。

对于 Web-scale 推理系统而言,这一点尤其关键。搜索、问答、对话、推荐和智能客服等场景都存在高频、重复、相似的用户请求。如何在保证模型效果的同时降低推理成本、提升响应稳定性,是大模型落地过程中非常现实的问题。RMS-MoE 提供了一种轻量但有效的思路:让模型记住自己过去做过的有效计算,并在相似场景中复用这些经验。

结语

随着大模型规模持续扩大,MoE 已经成为提升模型容量与推理效率的重要路线。但真正高效的 MoE,不应只是「稀疏激活更多专家」,还应当能够学习和复用专家之间的协作规律。

RMS-MoE 将检索、记忆与专家路由结合起来,为 MoE 架构引入了一种新的 architectural memory。实验结果表明,这种设计能够在 Web-scale QA 和多轮对话任务中同时改善准确率、推理延迟和路由稳定性

未来,随着大模型在搜索、对话、智能客服和复杂任务系统中的进一步部署,如何让模型的内部计算路径更加稳定、可复用、可解释,将成为提升大模型系统效率的重要方向。RMS-MoE 的工作表明:大模型不仅需要记住外部知识,也需要记住自己「如何思考」和「如何调度计算资源」。

作者介绍

陶万杰:马上消费金融人工智能研究院算法副总监,北京邮电大学硕士,长期从事金融垂直领域大模型、智能客服、知识工程与高可信 AI 服务系统研究。当前重点关注检索增强、混合专家模型、多智能体协同与金融场景下可控、可解释、可规模化的大模型应用,致力于构建面向真实业务场景的高效、稳定、可信智能服务系统。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
大满贯爆大冷!国乒劲敌0-3惨败,早田希娜剃光头,蒯曼三线出击

大满贯爆大冷!国乒劲敌0-3惨败,早田希娜剃光头,蒯曼三线出击

南海浪花
2026-08-12 15:14:28
原来两人是真夫妻!戏里戏外相伴20年,如今搭档赵丽颖终于大火

原来两人是真夫妻!戏里戏外相伴20年,如今搭档赵丽颖终于大火

古事寻踪记
2026-08-11 09:43:32
日本车评人评比亚迪:中国车的质量就是好,不像日本处处偷工减料

日本车评人评比亚迪:中国车的质量就是好,不像日本处处偷工减料

小七七七七
2026-08-12 21:04:53
热闻|大爆冷!WTT欧洲大满贯瑞典站头号种子一轮游,国乒4人挺进男单32强

热闻|大爆冷!WTT欧洲大满贯瑞典站头号种子一轮游,国乒4人挺进男单32强

齐鲁壹点
2026-08-12 06:58:20
外交部回应“日企高管在华涉案被拘留”:依法查处违法犯罪案件

外交部回应“日企高管在华涉案被拘留”:依法查处违法犯罪案件

每日经济新闻
2026-08-11 22:29:09
朝鲜再派数万援军上前线,甚至女工人也在路上,俄罗斯这次真打算决战了

朝鲜再派数万援军上前线,甚至女工人也在路上,俄罗斯这次真打算决战了

军武吐槽君
2026-08-10 23:38:28
深度长文:生命终会落幕,我们穷尽一生活着,到底有什么意义?

深度长文:生命终会落幕,我们穷尽一生活着,到底有什么意义?

宇宙时空
2026-08-11 14:40:10
殡葬业遭遇“寒潮”!老龄化加剧,为何“死人生意”反而亏钱了?

殡葬业遭遇“寒潮”!老龄化加剧,为何“死人生意”反而亏钱了?

铭记历史呀
2026-08-11 17:09:17
北大化学才女李天乐,潜伏在顶级药企工作十年,她利用职务之便领取铊,将清华丈夫一点点“熬”死在病房

北大化学才女李天乐,潜伏在顶级药企工作十年,她利用职务之便领取铊,将清华丈夫一点点“熬”死在病房

人生录
2026-07-30 00:05:08
朝鲜缺电的情况比越南严重得多,为什么中国不向朝鲜输电呢?说穿了,一旦给朝鲜送电,很可能变成一笔难以收回的巨额坏账

朝鲜缺电的情况比越南严重得多,为什么中国不向朝鲜输电呢?说穿了,一旦给朝鲜送电,很可能变成一笔难以收回的巨额坏账

谈史论今1
2026-08-10 19:57:55
中方接到消息,东北亚暴雷在即?朝鲜军方已介入,又一场战事逼近

中方接到消息,东北亚暴雷在即?朝鲜军方已介入,又一场战事逼近

最新声音
2026-08-11 21:11:38
上海“百年一遇”暴雨之后:数百亿工程能否填平防洪缺口?

上海“百年一遇”暴雨之后:数百亿工程能否填平防洪缺口?

夕落秋山
2026-08-12 23:40:05
医生调查:若50岁前没患这4种疾病,以后患癌的几率或微乎其微?

医生调查:若50岁前没患这4种疾病,以后患癌的几率或微乎其微?

读懂世界历史
2026-07-29 11:52:03
湖人缺席NBA揭幕战,引发湖人媒体强烈不满:这是对东契奇不尊重

湖人缺席NBA揭幕战,引发湖人媒体强烈不满:这是对东契奇不尊重

爱体育
2026-08-12 23:30:58
普京登上库页岛,朝鲜导弹飞向海参崴,俄朝选在同一天凌晨秀肌肉

普京登上库页岛,朝鲜导弹飞向海参崴,俄朝选在同一天凌晨秀肌肉

面包夹知识
2026-08-12 23:32:25
1988年,我国核武器专家张宪义带着机密携全家“叛逃”美国,28年后,他竟然在采访中给自己“洗白”

1988年,我国核武器专家张宪义带着机密携全家“叛逃”美国,28年后,他竟然在采访中给自己“洗白”

贱议你读史
2026-07-29 02:46:10
目不识丁、脑袋空空?易烊千玺获奖的发言,证明了冯远征说的没错

目不识丁、脑袋空空?易烊千玺获奖的发言,证明了冯远征说的没错

翰飞观事
2026-08-12 19:45:11
太吓人!广州一租客连夜“人间蒸发”,满屋行李没带走,押金放弃

太吓人!广州一租客连夜“人间蒸发”,满屋行李没带走,押金放弃

牛锅巴小钒
2026-08-12 11:27:47
央行:将继续发挥民营企业再贷款的激励作用 以市场化方式引导地方法人金融机构加大对民营企业的信贷投放

央行:将继续发挥民营企业再贷款的激励作用 以市场化方式引导地方法人金融机构加大对民营企业的信贷投放

每日经济新闻
2026-08-12 19:02:05
上海婚外胚胎案第三者的原生家庭,解释了一个小三是如何养成的

上海婚外胚胎案第三者的原生家庭,解释了一个小三是如何养成的

媒体人溪婉
2026-08-11 12:23:58
2026-08-13 00:36:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13742文章数 142718关注度
往期回顾 全部

科技要闻

Manus第二季,浪子回头

头条要闻

外卖小哥称"我人生最后一天啦" 女顾客收信息果断报警

头条要闻

外卖小哥称"我人生最后一天啦" 女顾客收信息果断报警

体育要闻

杜兰特,所谓的“联盟小王”

娱乐要闻

老戏骨杨昆两夺金鹰奖,因物业费被告

财经要闻

华尔街把AI算力炒成下一个房地产?

汽车要闻

这台大众不一般 上汽大众ID.ERA.5S综合续航约2000公里

态度原创

健康
教育
时尚
本地
手机

身子歪≠脊柱侧弯,侧弯发病率没变

教育要闻

大学专业正在重新洗牌:曾经的热门专业,为何逐渐失去就业优势?

炎炎盛夏,正好Sportique一下!

本地新闻

黄州一夜,苏轼写给普通人的月光

手机要闻

iPhone 18 Pro起步仍是256GB,制造成本涨近四成,折叠屏内部几乎定名Ultra

无障碍浏览 进入关怀版