网易首页 > 网易号 > 正文 申请入驻

MoE路由拥有「记忆」:RMS-MoE用检索记忆协同实现更高效专家调度

0
分享至



机器之心发布

大模型越来越大,Mixture-of-Experts(MoE)已经成为扩展模型参数规模、降低单次计算成本的重要架构之一。但在真实的 Web-scale 系统中,MoE 路由机制仍然存在一个容易被忽视的问题:它往往是「无记忆」的。

对于搜索、问答、对话等高并发场景,大量输入并非完全独立,而是具有显著的语义重复性和结构相似性。传统 MoE 路由器每次都从当前输入出发,重新判断应该激活哪些专家。这意味着,即使模型此前已经在相似输入上找到过有效的专家组合,下一次遇到类似问题时,仍然可能重新探索一遍。

这种「短视」的路由方式会带来三个问题:一是重复计算,导致推理延迟和资源浪费;二是路由不稳定,输入稍有扰动就可能触发完全不同的专家集合;三是专家之间的协作关系难以沉淀,模型只是在选择单个专家,而没有显式复用历史上有效的「专家团队」。

针对这一问题,来自马上消费金融、南京航空航天大学、阿里巴巴等机构的研究团队提出了RMS-MoE(Retrieval-Memory Synergy Mixture-of-Experts)。该工作将 MoE 路由从一次性的分类决策,重新定义为一个「检索 — 记忆 — 融合」的过程:模型不再只依赖当前 router 的即时判断,而是会从历史记忆中检索相似输入曾经激活过的高效专家组合,并与当前路由结果动态融合。



  • 论文标题:Rethinking MoE with Retrieval-Memory Synergy: Towards Efficient Expert Coordination
  • 会议:The ACM Web Conference 2026(WWW 2026)
  • 作者:Wanjie Tao, Qun Dai, Yantong Lv, Quan Lu, Ning Jiang, Zulong Chen
  • 机构:马上消费金融、南京航空航天大学、阿里巴巴
  • 论文链接:https://dl.acm.org/doi/epdf/10.1145/3774904.3792922

MoE 路由为什么需要「记忆」?

MoE 的优势在于稀疏激活。给定一个输入,router 会从多个专家中选择少数几个参与计算,从而在保持模型容量的同时降低每次前向计算成本。

然而,当前主流 MoE 路由方式大多仍然遵循一种 stateless paradigm:每个输入独立处理,历史上相似输入的专家选择经验并不会被系统性利用。

这在离线 benchmark 中可能不明显,但在真实 Web 场景中会变得非常关键。例如,在搜索、开放域问答、智能客服和多轮对话中,用户请求往往存在大量语义重叠。同类问题、同类任务、同类表达会反复出现。如果系统每次都重新计算专家分配,就会造成明显的计算冗余。更重要的是,对于语义相近的输入,如果专家激活集合频繁波动,模型行为也会变得不稳定。

RMS-MoE 的出发点是:既然用户输入具有重复性,专家协作模式也应该可以被记住和复用。与传统 RAG 从外部知识库检索文本内容不同,RMS-MoE 检索的不是知识片段,而是模型内部的专家协作模式。换句话说,它做的是一种 architectural memory:让模型记住自己过去是如何调度专家的

RMS-MoE:

从「即时路由」到「检索增强路由」

RMS-MoE 的整体框架由三个核心模块构成:Co-Activation Memory(CAM)、Adaptive Fusion Module(AFM)和 Reinforcement-Guided Memory Update。CAM 用于存储和检索历史上有效的专家组合;AFM 用于动态融合记忆先验和当前 router 的实时判断;强化反馈式更新则用任务反馈持续维护记忆质量。

从流程上看,当一个新输入进入模型后,RMS-MoE 首先通过 Input Encoder 得到输入表示,同时标准 router 会生成一个实时专家激活结果。与此同时,CAM 会根据当前输入表示,从记忆库中检索最相似的历史样本,并取出这些样本对应的专家激活模式。随后,模型会根据检索相似度和历史效用信息,聚合得到一个 memory prior,也就是「历史上相似输入更可能适合哪些专家团队」。最后,AFM 会学习一个动态融合权重,将 memory prior 与实时 router 输出结合,得到最终专家激活结果。

这种设计带来的好处是:对于熟悉、重复、语义相近的输入,模型可以更多依赖历史上验证有效的专家组合;对于新颖或低相似度输入,模型仍然可以回退到实时 router,保持灵活性。



RMS-MoE 方法框架图

Co-Activation Memory:

记住的不是知识,而是「专家团队」

RMS-MoE 的关键模块是Co-Activation Memory。CAM 可以理解为一个动态 key-value memory。每条记忆包含两部分:key 是输入 embedding,value 是对应的专家激活模式以及相关元信息,例如历史 reward、最近使用情况等。

当新输入到来时,模型会用当前输入 embedding 去 CAM 中检索 top-K 个相似条目。每个条目不仅代表一个相似输入,还携带了该输入曾经激活过的专家组合。随后,RMS-MoE 会结合相似度和历史效用,对这些专家组合进行加权聚合,得到一个专家选择先验。

这里的核心思想是:专家之间的共同激活关系本身就是一种可复用的结构知识。传统 MoE router 往往独立评估每个专家是否应该被激活,而 RMS-MoE 更关注「哪些专家曾经一起有效工作」。这使得模型不只是选择专家,而是在复用专家团队的协作经验。

Adaptive Fusion:

既相信记忆,也保留实时判断

仅有记忆是不够的。如果模型过度依赖历史经验,就可能在遇到新任务、新表达或低频场景时产生错误迁移。因此,RMS-MoE 引入了Adaptive Fusion Module,用一个可学习的动态门控系数 β 来控制记忆先验和实时路由之间的平衡。

当当前输入与 CAM 中的历史样本高度相似时,β 会更大,模型更倾向于使用记忆检索得到的专家组合;当相似度较低时,β 会降低,模型则更多依赖当前 router 的即时判断。这使得 RMS-MoE 不会变成一个简单的缓存系统,而是一个能够根据输入熟悉程度自适应决策的路由框架。

简单来说,RMS-MoE 的路由逻辑可以概括为:熟悉的问题,优先复用历史上表现好的专家团队;陌生的问题,回退到当前 router,保持探索能力;模糊的问题,在记忆和实时判断之间动态折中。

强化反馈式更新:让记忆持续进化

为了避免 CAM 退化成静态缓存,RMS-MoE 还设计了reinforcement-guided memory update。在训练过程中,模型会根据任务反馈更新记忆条目的效用分数。论文中将负训练损失作为 reward 信号,并使用指数滑动平均更新历史 reward。

同时,CAM 还会记录条目的新近程度,并在容量受限时基于 utility-recency score 进行淘汰。也就是说,一个专家组合如果在历史上多次带来较好任务表现,它就会更容易被保留和再次检索;如果一个组合长期无效或过时,则会逐渐被削弱甚至移除。

此外,CAM 更新被设计为异步机制。模型不会在每次前向传播中同步修改索引,而是将更新操作缓冲后批量执行。这种设计避免了检索索引对梯度计算的干扰,也降低了在线更新带来的系统开销。

实验:

在 WebQA 和 MultiWOZ 上同时提升准确率、延迟和稳定性

论文主要在 WebQA 上进行评估。WebQA 包含 120 万个问答样本,并具有约 30% 的查询冗余,非常适合测试记忆增强路由在高重复 Web 场景中的效果。同时,研究团队还在 MultiWOZ 上验证了方法在多轮任务型对话中的泛化能力。

实验对比了多种强 MoE 基线,包括 Switch Transformer、Expert-Choice MoE、Hash-MoE、Soft-MoE 和 DeepSeekMoE。所有模型使用相同的 MoE 基础架构:32 个专家,hidden dimension 为 1024,每个 token 激活 top-4 专家。RMS-MoE 额外设置 CAM 容量为 10^5,检索 top-5 个记忆条目。实验在 8 张 NVIDIA A100 GPU 上运行,并报告 10 次运行的均值和标准差。

在 WebQA 上,RMS-MoE 取得了最优结果。相较于 DeepSeekMoE,RMS-MoE 的 F1 提升 2.7 个点,归一化延迟从 0.72× 降至 0.53×,约降低 26%。相较于 Switch Transformer,RMS-MoE 的端到端延迟几乎减半。在 MultiWOZ 上,RMS-MoE 也保持了类似趋势,实现了 2.5 个 BLEU 分数提升和 34% 的延迟降低。这说明该方法并不局限于单一问答任务,也能够迁移到多轮对话场景。



WebQA 主实验结果(Latency 归一化至 Switch Transformer)

消融实验:CAM 是性能提升的关键

为了分析各模块贡献,论文进一步进行了消融实验。结果显示,移除 CAM 后,模型 F1 从 82.5 降至 77.3,稳定性从 0.94 降至 0.85,性能退化最明显。这说明历史专家协作模式的检索与复用是 RMS-MoE 的核心收益来源。

移除 Adaptive Fusion 后,F1 降至 78.2,说明简单使用记忆并不足够,模型必须根据输入情况动态决定「相信记忆」还是「相信当前 router」。移除 reinforcement-guided update 后,F1 降至 79.8,稳定性也出现下降,说明记忆质量的持续维护同样重要。

敏感性分析进一步表明,RMS-MoE 对关键超参数较为稳健。CAM 容量在 10^5 附近达到较好效果,top-K 检索数量在 K=5 时形成较优的准确率 — 延迟平衡,而融合门控 β 最终稳定收敛到约 0.6,说明模型会在相当一部分决策中主动利用记忆先验。



WebQA 消融实验结果

为什么这项工作重要?

RMS-MoE 的意义不只是提出了一个新的 MoE 变体,更重要的是,它重新思考了 MoE 路由的本质。过去,MoE 路由通常被看作一个即时决策问题:给定当前 token,选择若干专家。RMS-MoE 则把它扩展为一个具有历史经验的动态过程:当前输入不仅由当前 router 决定,也可以参考过去相似输入中已经验证有效的专家协作模式。

这带来了三个层面的变化。第一,路由从「无状态」变成「有记忆」。模型能够复用历史上成功的专家组合,减少重复探索。第二,专家选择从「单专家打分」走向「专家团队复用」。RMS-MoE 显式建模共同激活模式,让专家协作关系成为可检索、可强化、可淘汰的结构。第三,检索增强不再只发生在内容层。传统 RAG 检索的是外部知识或文本片段,而 RMS-MoE 检索的是模型内部架构行为。

对于 Web-scale 推理系统而言,这一点尤其关键。搜索、问答、对话、推荐和智能客服等场景都存在高频、重复、相似的用户请求。如何在保证模型效果的同时降低推理成本、提升响应稳定性,是大模型落地过程中非常现实的问题。RMS-MoE 提供了一种轻量但有效的思路:让模型记住自己过去做过的有效计算,并在相似场景中复用这些经验。

结语

随着大模型规模持续扩大,MoE 已经成为提升模型容量与推理效率的重要路线。但真正高效的 MoE,不应只是「稀疏激活更多专家」,还应当能够学习和复用专家之间的协作规律。

RMS-MoE 将检索、记忆与专家路由结合起来,为 MoE 架构引入了一种新的 architectural memory。实验结果表明,这种设计能够在 Web-scale QA 和多轮对话任务中同时改善准确率、推理延迟和路由稳定性

未来,随着大模型在搜索、对话、智能客服和复杂任务系统中的进一步部署,如何让模型的内部计算路径更加稳定、可复用、可解释,将成为提升大模型系统效率的重要方向。RMS-MoE 的工作表明:大模型不仅需要记住外部知识,也需要记住自己「如何思考」和「如何调度计算资源」。

作者介绍

陶万杰:马上消费金融人工智能研究院算法副总监,北京邮电大学硕士,长期从事金融垂直领域大模型、智能客服、知识工程与高可信 AI 服务系统研究。当前重点关注检索增强、混合专家模型、多智能体协同与金融场景下可控、可解释、可规模化的大模型应用,致力于构建面向真实业务场景的高效、稳定、可信智能服务系统。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
喝的中药大半是假货!药材全链条造假,千年中医被自己人毁掉

喝的中药大半是假货!药材全链条造假,千年中医被自己人毁掉

咸鱼金脑袋
2026-07-19 10:55:20
373名旅客滞留机舱超10小时,阿联酋航空确认:每人发放600欧元现金,部分乘客额外补偿里程积分

373名旅客滞留机舱超10小时,阿联酋航空确认:每人发放600欧元现金,部分乘客额外补偿里程积分

封面新闻
2026-07-31 18:59:05
里奇·保罗:布朗完全支持勒布朗加盟76人,跟他当队友能躲掉所有媒体压力

里奇·保罗:布朗完全支持勒布朗加盟76人,跟他当队友能躲掉所有媒体压力

绿茵狂热者
2026-08-01 00:38:03
李权哲肠子都悔青了!限流解约、综艺停播、连环反噬,彻底凉透

李权哲肠子都悔青了!限流解约、综艺停播、连环反噬,彻底凉透

洲洲影视娱评
2026-07-31 15:15:10
“王的带货”,刷屏!王虹穿搭引热议背后:2026年的中国,科学家不是必须放弃个人生活做“苦行僧”的

“王的带货”,刷屏!王虹穿搭引热议背后:2026年的中国,科学家不是必须放弃个人生活做“苦行僧”的

犀利强哥
2026-07-31 21:34:46
日本多家芯片巨头停产!

日本多家芯片巨头停产!

新浪财经
2026-07-31 14:48:52
赵露思真不拿网友当外人,穿比基尼又唱又跳,舞台上直接脱掉裙子

赵露思真不拿网友当外人,穿比基尼又唱又跳,舞台上直接脱掉裙子

无处不风景love
2026-07-13 11:24:03
中国股市:一份“不能买”的股票名单,献给1.6亿股民的真诚忠告

中国股市:一份“不能买”的股票名单,献给1.6亿股民的真诚忠告

股经纵横谈
2026-07-29 20:52:56
收手吧!“资本家的丑孩子”,没颜值没本事,就别出来祸害观众了

收手吧!“资本家的丑孩子”,没颜值没本事,就别出来祸害观众了

晓徙娱乐
2026-03-23 16:35:39
请印度网红“要饭哥”到家里吃饭的母女,到底是善良还是愚蠢呢

请印度网红“要饭哥”到家里吃饭的母女,到底是善良还是愚蠢呢

西楼知趣杂谈
2026-07-30 08:21:29
伊朗把希望寄托给中国!公开喊话:没有中方担保,我决不跟美国谈

伊朗把希望寄托给中国!公开喊话:没有中方担保,我决不跟美国谈

皇朝冰酷
2026-07-30 21:30:15
中国电磁炮专家,竟然是美国间谍,出卖大量情报,让国家损失惨重

中国电磁炮专家,竟然是美国间谍,出卖大量情报,让国家损失惨重

观察者小海风
2026-07-30 00:47:55
香格里拉虎跳峡景区附近塌方,连续两次,大量巨石滚落

香格里拉虎跳峡景区附近塌方,连续两次,大量巨石滚落

黄河新闻网吕梁
2026-07-30 16:40:27
沙特宣布:与科威特、巴林、卡塔尔、巴基斯坦、土耳其、埃及、约旦等13国组建联盟

沙特宣布:与科威特、巴林、卡塔尔、巴基斯坦、土耳其、埃及、约旦等13国组建联盟

每日经济新闻
2026-07-31 17:37:06
你见过最冷门的姓氏是什么?网友:活了几十年,一个都没听过

你见过最冷门的姓氏是什么?网友:活了几十年,一个都没听过

夜深爱杂谈
2026-07-31 20:32:44
13号台风登陆我国趋势增大,数千公里雨带形成,9省暴雨5省大暴雨

13号台风登陆我国趋势增大,数千公里雨带形成,9省暴雨5省大暴雨

老牛讲
2026-07-31 13:44:13
终于出手整治!散户,被量化折磨惨了……

终于出手整治!散户,被量化折磨惨了……

包不同
2026-08-01 00:51:58
事关住房公积金!国常会审议通过:拓宽提取和使用范围

事关住房公积金!国常会审议通过:拓宽提取和使用范围

南方都市报
2026-07-31 22:22:05
别再傻傻等表白了,女人默许你做这六件事,就是让你“泡”

别再傻傻等表白了,女人默许你做这六件事,就是让你“泡”

周哥一影视
2026-07-30 09:41:21
找对象别光看长相!这姑娘再好,不是过日子的人也不行

找对象别光看长相!这姑娘再好,不是过日子的人也不行

曹莽看世界
2026-06-22 15:21:34
2026-08-01 05:47:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13650文章数 142710关注度
往期回顾 全部

科技要闻

DeepSeek-V4-Flash正式版API上线公测

头条要闻

美官员:特朗普已下令对伊朗发动新一轮袭击

头条要闻

美官员:特朗普已下令对伊朗发动新一轮袭击

体育要闻

欧足联掀桌!因凡蒂诺这次真玩大了?

娱乐要闻

百花奖影帝影后即将决出

财经要闻

华强北显卡涨价潮 有显卡一周暴涨4000元

汽车要闻

听劝!换回机械门把手,这才是碳基生物该开的车!

态度原创

亲子
游戏
时尚
家居
军事航空

亲子要闻

多囊卵巢综合征为什么要更名?

《龙珠》新DLC难到令人发指!克林打弗利萨还原剧情?

推广中奖名单-更新至2026年7月10日推广

家居要闻

2026建博会(广州) 公装联探展交流活动

军事要闻

特朗普称哈马斯将全面解除武装

无障碍浏览 进入关怀版