网易首页 > 网易号 > 正文 申请入驻

给AI装上一个"可插拔的大脑记忆芯片",效果居然超越了更大的模型

0
分享至


这项由上海交通大学LUMIA实验室与上海人工智能实验室联合开展的研究,于2026年7月30日以预印本形式发布于arXiv平台,编号为arXiv:2607.27919v1。感兴趣的读者可通过该编号查阅完整论文,论文标题为《Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory》。

你有没有想过,为什么一个人学了十年物理,就很难再腾出脑子专门精通烹饪?不是他不聪明,而是他的大脑把记忆和思维能力"混在一起"存储了——学新知识有时会挤占旧知识的位置。今天主流的AI语言模型(就是那些能写文章、回答问题的聊天机器人)面临的恰恰是同一个困境。研究团队发现,现有的AI把"记住知识"和"会推理思考"这两件事塞进了同一堆参数里,导致你想给它增加新知识,就必须把整个模型重新训练一遍,代价极高,而且还可能让它忘掉以前学会的东西。

那么,能不能给AI单独配一个"记忆模块",像插U盘一样随时更换?这正是这项研究的核心思路。研究团队在前期工作Memory Decoder的基础上,将这个独立的"参数化记忆"模块扩展到了69亿参数的规模,并在3000亿个文字样本上进行了专门训练——这个数据量相当于把人类有史以来写过的文字读了好几遍。最终的结果令人印象深刻:一个4.1亿参数的小模型,搭配一个69亿参数的独立记忆模块,在17项测试任务上的平均得分从29.86跃升至37.34,超过了拥有120亿参数的大模型(得分37.24),而总参数量却少了整整39%。

换句话说,这就像用一个小而灵的运动员,搭配一个超大的"战术手册",最终打败了一个肌肉更发达但只靠本能作战的对手。

一、为什么AI的记忆和思维非要住在一起?

回到那个"大脑"的比喻。人类神经科学早已发现,记忆和推理依赖于大脑中部分不同的系统,两者可以在一定程度上独立运作。比如,一个失忆症患者可能记不住今天早饭吃了什么,但依然能完成复杂的逻辑推理。

现有的大型语言模型——比如GPT、Qwen、DeepSeek这类——却把这两件事强行捆绑在了一起。所有参数既负责"记住"世界知识(比如谁是拿破仑、金的化学符号是Au),也负责"理解语言"和"做逻辑推理"。这种设计有一个严重的副作用:当你想让模型专门学习法律知识时,你必须调整它的全部参数,这不仅耗时耗力,还可能让它在学完法律之后,忘记了如何正确做数学题,这种现象在学术界被称为"灾难性遗忘"。

另一种常见的解决方案是"检索增强生成"(RAG),可以理解为给AI配一个随时能查阅的图书馆。需要什么知识,就临时去书架上翻一翻,然后把翻到的内容塞进对话里一起处理。这个方法确实有效,但它有自己的麻烦——你需要维护一个庞大的图书馆(数据库),每次回答问题都要先跑去图书馆查询,速度慢,而且图书馆越大,查询费用越高。还有一种叫做"kNN语言模型"的技术,本质上类似于在一个超大的笔记本上找最相近的笔记,但这个笔记本可能有几百亿条记录,存储和搜索成本令人望而生畏。

这项研究走了一条完全不同的路:先让一个外部检索系统(kNN检索器)生成丰富的"知识分布"作为教材,然后把这些知识蒸馏进一个独立的神经网络(记忆模块)里。等训练完成后,那个昂贵的检索系统就可以扔掉了,记忆模块已经把知识内化成了自己的参数。推理时不需要查任何外部数据库,记忆模块直接输出它学会的东西。

二、记忆模块究竟是怎么工作的?

现在来解释一下这个"记忆芯片"的工作原理,不需要任何数学背景。

整套系统包含两个角色:一个是"主模型"(基础语言模型,负责理解语言、做推理),另一个是"记忆模型"(专门负责储存和提供知识)。两者在回答问题时同时工作,就像两个专家坐在同一张桌子旁各自给出建议,最后把两人的建议按一定比例混合,形成最终答案。

记忆模型在训练阶段要做两件事。第一件事是模拟检索器的行为:给定一段上下文,检索器会在语料库中找到最相似的句子,然后统计这些相似句子的"下一个词"分布——比如,在所有跟"金的化学符号"相似的上下文之后,有45%的概率接"Au",有30%的概率接"gold",有25%的概率接其他词。记忆模型的任务就是学会直接输出类似的分布,而无需真的去查那个庞大的数据库。第二件事是保留基本的语言建模能力,确保它不会偏离正常的语言规律太远。这两件事共同构成了记忆模型的训练目标,用一个混合损失函数来约束。

到了推理(使用)阶段,主模型和记忆模型各自读取同一段输入文字,各自给出"下一个词的概率分布",最后按照一个可调节的比例α(介于0到1之间)混合在一起。α越大,越依赖记忆模块;α越小,越依赖主模型。这个α可以针对不同任务单独调整,就像调音台上的旋钮——处理需要大量事实知识的问题时把记忆旋钮拧大,处理纯推理问题时把主模型旋钮拧大。

三、要训练这么大的记忆模块,数据处理是个大难题

在技术实现层面,研究团队遇到了一个几乎是工程上的"珠穆朗玛峰"。要训练通用记忆模块,他们需要在一个包含2070亿个词符(token)的去重版Pile数据集上构建kNN检索分布。问题在于,每一个词符位置都需要一次检索,而且数据库本身就有2070亿条记录。这意味着你需要在一个2070亿条记录的数据库里做2070亿次搜索,复杂度是天文数字级别。

普通的Faiss向量检索工具(Faiss是业内最常用的向量数据库工具)在这种规模下直接崩溃。研究团队因此开发了一套分布式检索流水线,分三步解决这个问题。

首先是压缩。每个词符的向量表示原本有4096个维度(可以理解为每个词符的"特征指纹"有4096个数字),研究团队用一种叫做OPQ的技术将其压缩到256个维度,大幅缩减存储空间和计算量,同时尽量保留检索的准确性。

压缩之后是分片。研究团队把整个数据库按照内部的"聚类中心"分割成多个小数据库(分片),每个分片独立存储在一个GPU上。这就好比把一个超大型图书馆拆分成几十个小分馆,每个分馆只负责一部分藏书。

最后是并行搜索。当需要为某个词符找最近邻时,先用一个轻量级的路由器(HNSW索引)判断这个查询应该去哪几个分馆,然后同时向多个分馆发送搜索请求,各分馆并行完成搜索后把结果汇总,找出真正的最近邻。

拿到最近邻之后,研究团队还需要把检索结果存储下来供训练使用。由于词汇表有5万多个词,每个位置的完整概率分布存储起来会占用巨大空间。研究团队利用了kNN分布的稀疏性——每个位置最多只有K个邻居,邻居的目标词汇可能重合,因此实际上有意义的词汇数量很少,平均只有约65个。只存储这些非零位置的词汇ID和概率值,存储量压缩了约250倍,整个系统才得以运转。

四、通用记忆与专业记忆,两种用途都能覆盖

研究团队在两个不同的应用场景下测试了这套系统,一个是"通用记忆",另一个是"专业领域记忆"。

通用记忆的思路是:用一个大规模的通用语料库(Pile数据集)训练记忆模块,然后把它插到不同规模的基础模型上,看看整体表现如何。研究团队分别训练了14亿、28亿和69亿参数三种规格的通用记忆模块,评估了涵盖常识推理、知识密集型问答、事实核查和幻觉检测的17项基准测试。

结果非常清晰。在每一种基础模型规模下,配上同等规模的记忆模块都能带来提升:14亿参数基础模型的平均分从32.76提高到34.36,28亿参数基础模型从33.89提高到35.49,69亿参数基础模型从36.30提高到37.79。更引人注意的是跨规模配对的结果:把一个4.1亿参数的小基础模型和一个69亿参数的记忆模块配对,平均得分达到37.34,超过了直接用120亿参数的基础模型(37.24),而两者加起来的总参数量比120亿参数模型少了39%。

这项发现可以用一个直白的类比来理解:雇一个聪明但知识面窄的助手,同时给他配一本超厚的百科全书,效果比直接雇一个知识面广但更贵的高级助手还要好——而且综合成本更低。

研究团队还仔细检查了17项任务中记忆模块到底在哪些地方发挥作用。在51个"任务×规模"的组合中,记忆模块在47个组合上都有提升,只有1个组合持平。提升最显著的地方是知识密集型任务,比如TriviaQA(一个需要大量世界知识的问答任务)在28亿参数配置下从8.30分跳升到了17.11分,2WikiMultiHopQA(需要跨多篇文章进行多步推理的问答)在14亿参数配置下从16.89提升到22.57,HotpotQA(另一个多跳问答任务)在69亿参数配置下从8.97提升到11.78。

专业领域记忆则是另一种用法。研究团队分别为生物学、法律和金融三个领域训练了专属的记忆模块(均为17亿参数),基础模型选用Qwen3系列,规模从6亿到140亿参数不等。结果是,专业记忆在每个基础模型规模下都能带来超过9个百分点的平均提升,而且最佳基线方法(包括对基础模型做领域继续预训练、LoRA微调、以及RAG)都被超过,最大领先幅度达到8.53个百分点。

专业记忆最吸引人的地方在于灵活性。基础模型完全不需要动,只需要在推理时切换激活不同的记忆模块就能切换专业领域——今天用生物记忆回答生物问题,明天换成法律记忆处理法律问题,后天再换成金融记忆。这就像给同一个人配了三套不同的专业参考书,随时换书就能变换专业方向,人本身不需要任何改变。

五、跨越语言边界:记忆模块可以"移植"到不同家族的模型上

一个自然的问题是:用Qwen3数据训练出来的记忆模块,能不能用在完全不同家族的模型上?这两类模型的词汇表(tokenizer)往往不同,就像两种不同编码系统写成的文件,直接对接会有兼容问题。

研究团队设计了一种迁移方案。他们把Qwen3记忆模块的词汇嵌入层和输出层替换成目标模型(OLMo-2-7B和OLMo-3-7B)的对应部分,然后用目标模型的语料库对记忆模块进行少量继续训练,训练量只有标准预算的20%。这就像把一本法文百科全书的封面和索引换成英文,然后让读者用两成的时间快速适应新格式。

迁移的效果令人满意。OLMo-2-7B在三个领域的平均分从19.57提升到23.83(提升4.26分),OLMo-3-7B从18.67提升到26.44(提升7.77分)。六项单独评估(两个模型×三个领域)全部都有提升,验证了记忆模块跨模型家族迁移的可行性。研究团队还发现,如果把迁移训练量从20%增加到100%,效果还能进一步提升,说明在资源允许的情况下,更充分的迁移训练会带来更好的结果。

六、少样本提示依然有效,记忆的优势不依赖于零样本条件

有人可能会担心:记忆模块的优势是不是只在"零样本"(不给任何例子,直接问问题)条件下才明显?一旦给模型提供几个示例(少样本提示),记忆模块是不是就没用了?

研究团队专门针对这个问题做了测试,在同一组13项任务上分别评估了零样本、3样本和5样本三种条件。结果显示,记忆模块在三种条件下都持续带来提升:零样本下平均提升1.43到1.87分,3样本下提升1.39到1.52分,5样本下提升1.22到1.62分。提升幅度虽然随着样本数增加略有收窄,但始终保持正向。这说明记忆模块和示例信息是互补关系,而非竞争关系——就像既有参考书又有例题,总比只有例题要好。

七、记忆模块是怎么"记住"东西的?一个词级别的显微镜观察

研究团队还做了一项有趣的"放大镜"实验,在一篇关于美国剧集《布鲁克林99》的HotpotQA参考段落上,观察记忆模块和基础模型在每个词上的贡献比例。他们计算了每个词的"记忆份额"——即记忆模块预测这个词的概率在两者总和中占的比例,高于0.5说明记忆模块更有把握,低于0.5说明基础模型更有把握。

观察结果与直觉完全吻合。对于"Fox"(播出电视台名)、"2013"(首播年份)、"Dan Goor"(创作者名字)、"Andy Samberg"(主演名字)这类具体的事实性词汇,记忆模块的份额明显更高,说明它确实在专门处理"记住事实"这件事。对于语法连接词、虚词等与事实无关的词汇,基础模型的份额更高,说明推理和语言理解的部分仍然主要由基础模型承担。这种分工正是整套架构设计的初衷:一个负责记住,一个负责思考。

八、记忆模块真的把检索知识"内化"了吗?

研究团队还做了一系列严谨的验证实验,证明记忆模块确实学到了检索器的知识,而不只是在输出格式上做了些表面文章。

他们从生物学记忆模块的训练数据中随机抽取了1024个样本,对比存储的kNN目标分布和记忆模块的实际输出分布。在这1024个样本上,记忆模块输出的最高概率词符与kNN目标分布的最高概率词符一致率达到86.62%,两者分布之间的平均KL散度(衡量两个概率分布差异程度的指标,越小越相似)为0.1820,平均TV距离(另一种衡量概率分布差距的指标)为0.0823,二者概率值的Pearson相关系数高达0.9174。

这些数字背后的含义是:记忆模块不只是猜对了"最可能的下一个词",它还准确地模拟了检索器对备选词汇的信心分布。进一步分析发现,目标分布较"集中"(只有一个词概率很高)的样本,记忆模块模仿得几乎完美,一致率达到99.50%。对于目标分布较"分散"(多个词概率相近,代表语境本身存在真实的不确定性)的样本,记忆模块的表现稍差,一致率68.47%,但仍然合理地分配了概率质量。

研究团队还专门检验了记忆模块是否使训练内容更容易被"提取"出来——也就是说,给定前缀,能不能更准确地续写出训练文本。在生物学酶功能标注任务上,记忆模块的严格精确匹配率(EM@8,16,即给定8个前缀词符后能准确预测接下来16个词符的比例)达到49.7%,而同等参数量、同等训练数据量的继续预训练模型只有42.4%。在另一项"领域锚点补全"任务(给定部分输出,让模型补全特定词组)中,记忆模块的匹配率更是从22.6%跃升至56.5%,差距悬殊。

九、训练目标本身很关键,不只是"插两个模型做平均"

有人可能会质疑:记忆模块的提升,是不是只是因为相当于用了两倍参数量?只要把任何一个17亿参数模型挂在基础模型旁边,输出做平均,是不是也能得到类似效果?

研究团队专门设计了对照实验来排除这个可能性。他们拿了一个Qwen3-1.7B-Base模型,用完全相同的训练数据、计算量和参数量,但改用普通的继续预训练方式(而非记忆训练目标)来训练,然后以完全相同的"平均输出"方式挂到基础模型旁边。结果对比显示,在BioInst任务上,记忆模块比"挂载继续预训练模型"分别高出10.21分(搭配1.7B基础模型)和8.71分(搭配8B基础模型);在LawBench任务上,也分别高出1.68分和3.93分。这四个比较全部指向同一个结论:提升来自于记忆训练目标本身,而不是简单的参数叠加。

说到底,这项研究揭示的不只是一个技术技巧,而是一种重新理解AI系统构建方式的思路。长期以来,AI模型的规模竞赛逻辑是"越大越好"——参数越多,知识越丰富,能力越强。这项研究表明,换一种思路同样可行:保持推理核心的精简,专门建立独立的知识存储模块,按需插拔。

这种架构思路的现实意义体现在几个层面。对普通用户而言,未来的AI助手也许不再需要每次更新时把整个大模型重新训练一遍,而只需要更新记忆模块,就像给手机系统升级应用程序而不是刷固件。对企业用户而言,可以用同一个推理基础模型,根据业务场景随时切换专用记忆模块,法务部门用法律记忆,研究部门用科学记忆,财务部门用金融记忆。对算力有限的场景而言,小基础模型+大记忆模块的组合意味着可以在更低的硬件成本上达到更高的实际效果。

当然,研究团队也坦诚地指出了现有局限:构建kNN分布的离线处理成本依然不小,固定的α插值系数也可能不是最优方案——理想情况下应该根据每个输入动态调整记忆模块的权重。这些问题指向了未来的改进方向。

如果你对这套系统的完整细节感兴趣,可以通过arXiv编号2607.27919查阅原始论文,代码也已在GitHub的LUMIA-Group/MemoryDecoder-at-Scale仓库开源。

Q&A

Q1:Memory Decoder的记忆模块在推理时还需要访问外部数据库吗?

A:不需要。Memory Decoder的记忆模块在训练阶段借助kNN检索器构建监督信号,但训练完成后,检索器就可以完全丢弃。推理时记忆模块仅凭自身参数输出概率分布,与基础模型并行运行后直接加权融合,全程不访问任何外部数据库,这也是它区别于RAG(检索增强生成)等方法的核心优势。

Q2:Memory Decoder的记忆模块能直接用在任何现有的大语言模型上吗?

A:基础用法是同一家族模型之间插拔,基础模型保持冻结不变,记忆模块以相同词汇表训练后直接配合使用。跨家族迁移(如从Qwen3迁移到OLMo)需要替换词汇嵌入层和输出头,然后用少量目标模型语料进行继续训练。实验显示,仅用20%的标准训练预算完成迁移,在生物、法律、金融三个领域仍能带来显著提升,说明跨模型迁移是可行的。

Q3:Memory Decoder的记忆模块越大效果越好吗,有没有上限?

A:在实验覆盖的规模范围内(从6亿到69亿参数),记忆模块越大带来的提升越明显,且对较小基础模型的增益幅度更大。目前实验还没有观察到明显的效果天花板,但研究也指出,记忆模块的训练预算(训练时间和数据量)同样重要,训练越充分效果越好,说明规模和训练量两个维度都有提升空间。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
网红“老表”意外溺水离世:扛着病痛打工8年,新房还只是毛坯|封面深镜

网红“老表”意外溺水离世:扛着病痛打工8年,新房还只是毛坯|封面深镜

封面新闻
2026-08-11 13:30:21
DeepSeek和豆包用了半年,我果断卸载了其中一个,原因太真实!

DeepSeek和豆包用了半年,我果断卸载了其中一个,原因太真实!

侃故事的阿庆
2026-08-11 06:56:01
钟睒睒四上央视,一层层拆穿了电商平台的底裤:消灭中间商的,成了最大的中间商

钟睒睒四上央视,一层层拆穿了电商平台的底裤:消灭中间商的,成了最大的中间商

狠人搞钱
2026-08-10 08:03:11
4 家医院拒诊!腹痛患儿连跑 5 家医院!一场医疗事件的影响有多大?这个国家一代儿科医生出走!儿科年年亏损,医疗服务提价有用么?

4 家医院拒诊!腹痛患儿连跑 5 家医院!一场医疗事件的影响有多大?这个国家一代儿科医生出走!儿科年年亏损,医疗服务提价有用么?

梅斯医学
2026-08-11 07:53:23
20天亏5亿:头部网红,一夜返贫

20天亏5亿:头部网红,一夜返贫

最人物
2026-08-11 16:06:48
1950年朝鲜战场:李克农含泪质问粟裕:我儿子还活着吗?

1950年朝鲜战场:李克农含泪质问粟裕:我儿子还活着吗?

星宇共鸣
2025-07-24 17:42:45
空调立大功:医生发现:经常吹空调的老年人,或有这7大好处

空调立大功:医生发现:经常吹空调的老年人,或有这7大好处

岐黄传人孙大夫
2026-07-30 17:30:03
山东呆小伙结婚,新娘只有8岁智商,网友:清纯漂亮,谁不喜欢

山东呆小伙结婚,新娘只有8岁智商,网友:清纯漂亮,谁不喜欢

荔子言
2026-08-10 17:08:01
中国移动这回真“下本”了?10年不换号的人,这4类权益或能享受

中国移动这回真“下本”了?10年不换号的人,这4类权益或能享受

次元君情感
2026-08-06 11:45:52
朱俊龙交易悬念加剧!首钢广厦互不相让,CBA格局或将重塑

朱俊龙交易悬念加剧!首钢广厦互不相让,CBA格局或将重塑

生活新鲜市
2026-08-12 00:08:17
陈松伶回应暴瘦争议:否认健康问题,每天500个深蹲,四年减重40斤

陈松伶回应暴瘦争议:否认健康问题,每天500个深蹲,四年减重40斤

娱乐嗑学家.
2026-08-11 17:05:40
结婚四十年都是AA制!丈夫全屋装七八个监控设防,妻子:他怕我会害他

结婚四十年都是AA制!丈夫全屋装七八个监控设防,妻子:他怕我会害他

福建第一帮帮团
2026-08-10 20:56:16
30岁意外去世!美国知名攀岩运动员死因揭晓:攀爬发生致命坠落

30岁意外去世!美国知名攀岩运动员死因揭晓:攀爬发生致命坠落

全景体育V
2026-08-11 07:58:53
“山旮旯”17岁广东球员地域歧视贵州+挑衅 惹众怒道歉:无地自容

“山旮旯”17岁广东球员地域歧视贵州+挑衅 惹众怒道歉:无地自容

念洲
2026-08-11 08:11:20
飞机上大妈占了我的商务座说心脏不好,我当即加2200升头等舱,20分钟后,她的女儿追了过来

飞机上大妈占了我的商务座说心脏不好,我当即加2200升头等舱,20分钟后,她的女儿追了过来

烟火人间故事汇
2026-08-11 20:35:06
台风白海豚突然拐弯,山东暴雨预警取消,虚惊一场背后藏着什么

台风白海豚突然拐弯,山东暴雨预警取消,虚惊一场背后藏着什么

老五汽车世界
2026-08-11 13:30:55
一个前美军中将的脖子,怎么就扯下了这个时代的信任遮羞布?

一个前美军中将的脖子,怎么就扯下了这个时代的信任遮羞布?

刻面
2026-08-10 15:37:02
资本的力量!联盟为伦纳德妥协,2000亿大佬的威力,其他29队眼馋

资本的力量!联盟为伦纳德妥协,2000亿大佬的威力,其他29队眼馋

你的篮球频道
2026-08-11 09:20:59
泽连斯基发现大事不妙,除了朝鲜之外,俄罗斯又拉来一个狠角色

泽连斯基发现大事不妙,除了朝鲜之外,俄罗斯又拉来一个狠角色

照亮你的前行之路
2026-05-23 01:15:00
同济大学全体关切公平的教师致杨金龙校长公开信

同济大学全体关切公平的教师致杨金龙校长公开信

紫京讲谈
2026-08-10 16:49:29
2026-08-12 05:31:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9491文章数 568关注度
往期回顾 全部

科技要闻

AI大战变天:扎克伯格突然回头

头条要闻

网红"雅典娜"失踪3年 好友:她被李姓女网友诱骗至境外

头条要闻

网红"雅典娜"失踪3年 好友:她被李姓女网友诱骗至境外

体育要闻

NBA老顽童,抽着大麻喝着小酒告别了

娱乐要闻

“雅典娜”确认被害 细节令人发指!

财经要闻

AI泡沫的剧本,是2008年的次贷危机?

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

本地
游戏
艺术
手机
亲子

本地新闻

黄州一夜,苏轼写给普通人的月光

淘宝百亿补贴 港版PS5轻薄款降至3600元:可冲了?

艺术要闻

色彩的盛宴,视觉的狂欢:西班牙水彩大师福斯蒂诺·马丁·冈萨雷斯的艺术世界

手机要闻

iQOO Z11S再预热,宁德新能源联合研发电池

亲子要闻

一定要让孩子知道,朋友是流动的!

无障碍浏览 进入关怀版