![]()
你有没有想过,一个每天陪你聊天、帮你处理事务的AI助手,它记住的东西到底存在哪里?
大部分人可能觉得这是个技术细节,不值得关心。但事实是,现在几乎所有部署在真实场景里的AI智能体,都用同一种方式存储长期记忆:一堆markdown格式的文本文件,像你电脑里的文档一样,分门别类放在文件夹里。这不是某个实验室的奇思妙想,而是整个行业不约而同的选择。Anthropic给Claude配了一个"记忆工具",本质就是六个操作文件的函数。Claude Code会在你的项目里维护一个笔记文件夹。就连行业里流行的"技能"标准,也是打包成仓库里的markdown文档来分发的。
这件事情本身透着一种耐人寻味的矛盾。
学术界这些年拼命设计各种精巧的记忆结构,有像操作系统一样分页管理上下文的,有专门抽取事实建立数据库的,有做时序知识图谱的,还有让笔记之间自动建立链接的。这些方案听起来一个比一个复杂精妙。可当真正要落地的时候,工业界却选择了最朴素的方案:文件加文件夹。
这就好比一群建筑师绞尽脑汁设计出各种炫酷的收纳系统,结果搬进新家的人还是选择了最普通的衣柜和抽屉。这不是说文件系统不好,而是说没有人真正验证过一个基本假设:当这个文件柜里的东西越堆越多,AI自己真的能把它管理好吗?
这就是这篇论文要回答的问题。来自伊利诺伊大学香槽分校、加州大学圣地亚哥分校等机构的研究者们,做了他们所知的第一次系统性研究,专门探讨"文件系统式记忆"这件事到底靠不靠谱。
记忆堆成山之后,谁来打扫?
先说清楚问题出在哪里。
如果只是把东西写进去,再原样读出来,这件事一点都不难。难的是时间一长,记忆会越堆越多,里面必然会出现重复的内容、互相矛盾的说法、过时的信息,还有本该归在一起却散落在各个角落的碎片。
想象一下你刚搬进新公寓时的文件柜,整整齐齐,一个文件夹一个主题。三年过去,水电费单据、旧合同、过期的保修卡、几次搬家攒下的说明书全都堆在里面,新来的账单不知道塞进哪个夹子,你也记不清某张重要发票到底放在了"财务"文件夹还是"杂项"文件夹里。如果没人定期整理,这个文件柜迟早会从"帮你记事"变成"帮你添乱"。
AI的记忆库面临的是同样的困境,只是这次没有一个人负责周末打扫,得靠AI自己完成这份工作。
行业里已经意识到这个麻烦,但给出的解决方案是绕开问题而不是解决问题。
外部清理是治标不治本
比如OpenAI给ChatGPT做的"追梦"机制,是在后台悄悄生成一份扁平化的记忆摘要;Anthropic的Dreams功能更是直接把整个存储推倒重建。这两种做法的潜台词都很诚实:他们承认,AI自己日常的写入是"局部且零碎的",记忆库会在两次大扫除之间持续变差。
问题是,这种依赖外部重建的方式,本质上等于承认AI自己管不好这个仓库,需要一个隔一段时间就来大扫除的清洁工。可现实中,没人能保证这个清洁工总是按时出现,也没人验证过,如果不靠外部干预,AI自己长期坚持整理到底能做到什么程度。
这篇论文想搞清楚的正是这件事:文件系统这个默认选择背后藏着两个从没被认真检验过的假设,一是智能体能不能在记忆持续增长的过程中,自己维持住秩序;二是这份秩序到底值不值得费这个功夫去维持。
把记忆管理拆成三个角色
要研究这么复杂的问题,研究者们先做了一件基础工作:把整个记忆系统抽象成三个角色,围绕同一个存储空间转。
管理智能体*:负责把新进来的信息整合进记忆库,同时保持整体的条理性,相当于图书馆的编目员。
搜索智能体*:负责回答问题,并且每个答案都要标明信息来源,类似图书馆的咨询员。
执行智能体*:在有具体任务要完成的场景里出现,它做事时产生的经历会变成新的记忆素材,同时也会从记忆库里调取有用的技能。
这三个角色共享同一套规则,却各自专注不同的事。管理智能体拿到一段新内容,不是简单地扔进仓库,而是要判断该放在哪个文件里,是否要新建文件夹,是否要跟已有内容合并或者拆分。搜索智能体面对一个问题,要在文件堆里翻找,给出有出处的答案。
这个设计有个巧妙之处:它统一了两种听起来完全不同的记忆类型。一种是陈述性记忆,就是关于事实、偏好、规则这类"知道什么"的信息;另一种是程序性记忆,也就是"知道怎么做"的技能。以前的研究往往把这两者分开处理,这篇论文说,其实可以用同一个文件系统装下两者,只是内容不同而已。
研究者为了验证这套框架,选了两类完全不同的测试场景。一类是长对话问答,考验AI记不记得住几十次对话前说过的话;另一类是具身智能体任务,类似让AI在虚拟家庭环境里完成"把苹果放进冰箱"之类的家务,考验它能不能把过去做任务的经验总结成可复用的技能。
文件柜自己会怎么长成什么样?
如果放任AI自由发挥,让它自己决定怎么组织文件,会长出什么样子的结构?
研究者发现一个很直接的结论:文件系统的形状,主要取决于用的是哪个AI模型,而不是取决于内容有多少。
这句话乍一听有点反直觉。你可能会觉得,内容越多,自然需要越精细的文件夹结构来分类,这不是常识吗?但实验数据推翻了这个直觉。
拿同一段对话来说,当研究者只是把内容量从32k token增加到128k token,也就是差不多五倍的量,AI管理出来的文件结构却变得更加集中,而不是更加分散。文件夹和文件层从原本大约三个文件夹装十二个文件,压缩成一个文件夹里只有两个文件,但这两个文件内部的标题层级却从53个暴涨到210个。
换句话说,内容多了,AI没有开更多的抽屉,而是把新东西塞进已有抽屉,再在抽屉内部隔出更多小格子。
这就好比你搬家时东西越来越多,有些人会去买更多的收纳箱,有些人却选择在同一个箱子里塞进更多分隔板。这两种做法都能"装下"东西,但找起来的体验天差地别。研究发现,不同的AI模型有各自固定的"收纳性格",跟东西多少关系不大。
更能说明问题的是模型之间的差异。在同样的128k对话上,如果换成能力更弱的模型来管理,它会把内容拆成122个文件,分布在12个文件夹里,近乎"每个话题都单独立档";而中等能力的模型会把整个对话压缩进2个文件,内部靠210层标题结构来组织;能力最强的模型则拆分出105个文件,内部嵌套深度达到7层,还用233个交叉引用把这些文件串联起来,是中等模型的三十多倍。
同一份对话素材,三个不同能力的模型,能整理出三种截然不同的文件柜样式,这说明AI的"整理风格"其实更像是它自己的性格签名,而不是对素材量的理性响应。
论文里还发现一个更值得警惕的现象:如果只是让AI重新整理已有内容,不给它任何额外指示,它默默地会开始丢东西。
研究者管这个叫"默认的压缩倾向"。在没有明确要求"保留每个事实"的情况下,AI重新整理笔记时,内容会悄悄缩水,细节被遗漏。只有加上一条"必须保留所有事实"的规则,AI才会老老实实把内容量维持住。
这个发现的分量不小。想象你请一个助理帮你重新排列书架,如果你没有特别叮嘱"每一本书都要留下",这个助理很可能会觉得有些书"看起来不重要"就顺手扔掉。AI在整理记忆时表现出的正是这种倾向,它默认认为压缩和精简是好事,除非你明确告诉它别这么干。
组织到底值不值得?答案是:看情况
这是整篇论文最核心的一个发现,答案没有那么爽快,却异常真实。
研究者对比了六种不同的记忆存储方式,从什么都不存的"闭卷模式",到原样堆叠的逐句转储,再到AI自主整理的精心组织版本,横跨四个测试基准。结果发现,没有一种组织方式能在所有场景里都赢。
先看一个基本事实:什么都不存,答题的正确率只有18.4%(在LoCoMo这个长对话基准上),而只是简单地按块检索原文,正确率就能冲到81.6%。这说明记忆本身,不管以什么形式存在,都远比完全没有记忆强得多。
但一旦比较各种"有记忆"的方式,组织带来的好处就变得含糊起来。最省成本的一种做法,只是把原始的对话记录按主题分文件夹归类,不改动任何一个字,这种最朴素的组织方式反而在多个测试里名列前茅。而AI精心重新整理、大费周章生成的存储结构,有时候表现反而更差。
比如在PersonaMem这个基准的32k档次上,精心整理的存储只拿到37.5%的正确率,而完全不整理的逐句转储却能拿到78.1%,几乎是它的两倍还多。
这个数字差距背后藏着一个更微妙的问题。研究者深挖之后发现,这不是因为AI在整理时丢了信息(所有关键事实都还在),而是整理这个动作本身悄悄破坏了三个原本对答题至关重要的线索。
第一,原来的记录里,一个观点后来被更新了,原文会保留时间顺序,让你知道"这是后来才成立的说法"。但整理后,过时的偏好和最新的偏好被并排放在一起,都用现在时描述,读起来就像两者同时成立,而实际上后者才是真的。
第二,原话里带着强烈的感情色彩,比如某人激动地说"这个应用简直改变了我的生活",整理后变成一句中性描述的功能清单,情感线索没了,后续判断"这个人到底喜不喜欢这个应用"时就会误判。
第三,原本一条完整的故事线,被拆散到不同的文件和章节里,决定性的更新信息常常没有和其他相关内容放在一起读到。
这就像你把一本按时间顺序写的日记,重新整理成按主题分类的笔记本。整理后确实更方便按话题查找,但你失去了"某件事在什么时候发生了变化"这条时间线,而恰恰是这条时间线,决定了你现在应该相信哪个版本。
研究者进一步验证了这不是记忆形式本身的问题,而是负责整理的那个AI模型能力不足导致的。他们把管理智能体换成一个更强的模型,重新构建同一批对话的存储,结果搜索智能体在同样32道题上,答对的题从12道涨到18道。这说明,只要负责写入记忆的模型足够聪明,能够可靠地按照"记录变化而不是覆盖历史"的指令去操作,组织带来的信息损失是可以避免的。
不过组织确实有一个毫无争议的好处:省钱。
在内容量特别大的场景下,整理过的存储能把搜索成本砍掉一半甚至更多。研究者做了细致的成本核算,在PersonaMem 128k这个大规模场景里,原始转储每次查询要花3.9到4.0分钱,而经过重新整理或AI精心组织的存储,每次查询只需要1.4到2.6分钱。这个省钱效应在小规模场景里就不明显了。
这个规律其实很好理解。如果你的资料只有薄薄一页,不管有没有目录,翻到想要的内容都很快。但如果资料堆积成几百页,有没有目录页、有没有分章分节,差别就大了去了。组织的价值,是随着数据规模变大才逐渐显现的。
在具身任务的场景里,故事又有了新的转折。这次的对比对象是原始逐字记录的经历日志,和经过AI提炼后的技能库。结果发现,哪种方式更好,取决于负责执行任务的AI模型有多强。
面对能力更强的执行者,直接给它看完整的原始经历日志效果最好,达到87.1%的成功率;而面对能力较弱的执行者,提炼过的、专门为任务定制的指导反而领先,达到76.4%,比直接看原始日志高出十个百分点。
这个现象背后的机制其实相当直白:原始的经历记录信息量大但也杂乱,需要执行者自己具备较强的能力去消化提炼出有用信息;而经过提炼的指导已经帮它把重点划出来了,即使执行者本身能力有限,也能跟着走。
这就好比给一个刚上路的新手司机一份详细的地图和逐条转弯指示,他能顺利到达目的地;而如果只给他一段老司机的行车录像,让他自己从里面总结出该往哪走,新手很可能因为信息过载而找不到重点,但一个经验丰富的老司机反而能从录像里读出比文字指示更丰富的信息。
模型的能力强弱,到底在哪个环节起作用
这一部分的发现有点出人意料。研究者原本以为,换一个更强的模型来管理记忆,答案质量应该会随之提升,毕竟更聪明的模型理应把资料整理得更好。但数据讲的是另一个故事。
在对话场景里,把管理智能体从弱模型换成强模型,答题正确率几乎没有变化,始终在66.7%到73.8%这个不到十个百分点的区间里晃动,甚至不是随模型能力单调上升的。反倒是把搜索智能体换成更强的模型,正确率会稳步从62%左右一路涨到79%。
也就是说,负责"写"记忆的模型强不强,对最终答案质量的影响微乎其微;而负责"读"记忆的模型强不强,才是真正决定答案好坏的关键。
这个发现有点像是说,一个图书馆的编目方式虽然千差万别,但只要请一个足够聪明的图书管理员来查资料,他总能在任何编目体系里找到想要的书。管理智能体的能力更多体现在它整理出来的"风格"上,而不是这份风格带来的实际检索价值。
但这个规律不是绝对的。当研究者去看具身任务这一侧时,发现了一个明显的能力门槛效应。管理智能体的能力从弱到强,底部两档几乎没差别,但一旦跨过某个门槛,效果会突然跳升。最强的那档模型带来了13个百分点的提升,而且这个提升主要集中在两类真正需要把经验抽象成可迁移技能的任务类型上。
为什么会有这种差异?论文给出的解释是,写记忆的动作分成两种性质完全不同的工作。在对话场景里,写记忆本质上是"把已经存在的信息重新整理排布",这件事对模型能力要求不算太高,一般水平就能完成。而在技能提炼场景里,写记忆意味着要把一堆杂乱的、带着噪音的具体尝试记录,提炉出一个能适用于同类问题的通用方法,这需要真正的抽象和归纳能力,弱模型很难做到。
一个具体的例子特别能说明问题:在"加热食物"这个任务类型上,能力较弱的模型认真地建立了十二个跟加热相关的文件,结果只有6%的成功率;而最强的模型只写了两个内容更密的文件,成功率却达到75%。
多不代表好,关键在于每一条记录里到底装着多少真正有用的判断。
工具箱本身,也在悄悄塑造记忆的样子
这篇论文还发现了一个容易被忽略的变量:AI用来操作文件的工具本身,会直接影响它整理出来的记忆结构。
研究者对比了三种工具配置。第一种是标准的文件操作函数集,类似给AI一套"新建文件、编辑、删除、改名"的基本工具;第二种是在此基础上加了一个关键词搜索引擎;第三种是直接给它一个完整的命令行终端,让它像程序员一样用bash命令操作文件系统。
结果非常明显:在长对话场景里,给AI一个命令行终端,它会把内容拆得极其细碎,最多能拆出147个小文件;而用标准文件工具的AI,倾向于把所有内容压缩进一两个大文件里。这是一个跨越两个数量级的差异,而唯一变化的东西只是操作工具。
这个反差很值得琢磨。同一个AI模型,同样的对话内容,仅仅因为拿到的工具不同,就表现出截然不同的"收纳性格"。用命令行的AI,天生更熟悉文件和目录的操作逻辑,自然而然会用分门别类的方式思考;而用简单编辑工具的AI,倾向于把所有信息塞进能编辑的少数几个文件里。
有意思的是,尽管存储结构天差地别,答题的准确率却相差不大,大多数情况下只是一两道题的差距。这说明搜索智能体有相当强的适应能力,不管你把资料整理成什么形状,它都能找到办法把该找的信息挖出来。
但在具身任务这一侧,工具的影响就不只是"改变行为不改变结果"这么简单了。给它加一个额外的搜索工具,行为确实变了,但成绩几乎没变化。可如果直接换成命令行工具,成绩明显提升,这个配置产生的存储库是所有中等能力模型构建的存储里成绩最好的一个,达到82.9%的成功率,甚至超过了用更强模型管理出来的某些配置。
这说明工具不是一个中立的传递管道,它会实实在在地影响AI整理信息的方式,而这种影响在不同场景下,方向和收益也完全不同。这就像给同一个工匠换一套不同的工具,他打磨出来的家具风格会随之改变,有时候换个工具反而能激发出更好的手艺。
记忆越堆越多,会不会自己乱掉?
最后一个核心问题回到了论文最初提出的那个悬念:随着时间推移,AI自己维护的记忆库会不会越来越混乱,最终变得不可用?
研究者做了一个持续追踪实验,让AI连续处理140个任务,每完成一个任务就在存储上留下一次"快照",这样就能画出整个记忆库随时间演变的完整轨迹。
好消息是,在他们能测试的时间跨度内,记忆库并没有变得越用越差,反而越用越有用。每一种存储方式,从任务链的开头到结尾,表现都在持续上升,没有出现"越积累越混乱"的退化现象。
尤其值得一提的是,这种积累效应对能力较弱的执行者反而更明显。用能力较弱的模型执行任务时,如果配上原始经历日志,一开始的成绩跟完全没有记忆时一样差,但到任务链末期,成绩反超了强模型在独立三段任务里的平均水平。这说明积累的经验,能在一定程度上补偿模型本身能力的不足。
不过好消息里也藏着隐忧。研究者发现一个规律:早期写下的记忆文件基本上都被完好地保留下来,很少被删除,大多数情况下是被反复编辑,内容在原地不断更新完善,而不是被推翻重写。这本身是件好事,说明记忆库没有出现"边写边丢"的问题。
但另一方面,组织的整齐程度会随着存储不断增长而慢慢变差。研究者用一套指标衡量文件树是否符合"相关内容离得近、无关内容离得远"这个基本组织原则,发现绝大多数存储库随着任务数量增加,这个指标会逐渐下滑,只有最强的那个管理模型能把这个指标一直维持在稳定水平。
这就像一间办公室,如果每个人都只顾着往文件柜里塞新文件,却没人花心思重新调整分类标签,时间一长,即便所有文件都还在,找起来也会越来越费劲。内容没丢,但秩序在流失。
而在成本这条线上,论文给出了一个更实际的提醒:整理这份工作从来不会因为熟练而变便宜。研究者发现,不管AI已经处理过多少任务,每处理一个新任务所需要投入的整理精力基本保持不变,始终维持在六到十二轮操作之间,没有出现"越做越快"的规律。这跟人类干熟练工作后效率提升的直觉不太一样,提醒我们AI的"维护记忆"这件事,本质上还是一件需要持续投入的活儿,不存在一劳永逸的捷径。
写在后面
读完这篇论文,最让我意外的一个细节,是研究者发现"整理"这个动作本身可能是有害的,除非明确要求保留细节。这跟我们通常对AI的信任感有点冲突,我们习惯认为,让AI帮忙"归纳总结"是件安全的事,毕竟它看起来那么擅长概括。但论文里那个具体案例说得很清楚,一句带着情感的原话被压缩成中性的功能清单之后,后续关于"这个人到底喜不喜欢"的判断就直接翻车了。
这提醒我一件事,AI的"整理"和人类的"整理"看起来是同一个词,但背后的判断逻辑可能完全不一样。人在整理笔记时,会本能地保留那些带着强烈情绪或者暗示未来会变化的句子,因为我们知道哪些信息"有话外之音"。AI默认没有这种直觉,除非你把这条规则明明白白写进指令里。
论文里还有一个数字让我反复琢磨:同一个模型,换一套操作工具,写出来的文件结构可以从两个文件变成一百四十七个文件。这比换模型带来的差异还大。这意味着我们平时讨论"哪个AI更聪明"的时候,可能忽略了一个更基础的变量,同一个AI用不同的工具,表现出来的性格可能比换一个模型更不一样。
如果记忆库的组织方式主要取决于工具而不是智能本身,那我们是不是应该反过来想,怎么设计工具,才能诱导出我们真正想要的那种整理习惯?
Q&A
Q1:文件系统式记忆和以前学术界研究的知识图谱、向量数据库等记忆方案有什么不同?
A:知识图谱和向量数据库是学术界设计的专门化记忆结构,通常需要特定的接口和检索机制。文件系统式记忆用的是最普通的文件和文件夹,AI通过读写文件、创建目录这类基本操作来管理记忆,这也是工业界实际部署时普遍采用的方式,因为它便于检查、可移植,而且用的是AI已经熟悉的文件操作工具。
Q2:为什么AI自己整理记忆时,反而会让答案变得更差?
A:论文发现,AI在自主重新整理记忆时,默认会悄悄压缩内容,丢掉时间顺序、情感语气这些看起来"不重要"但实际上对判断很关键的线索。比如把一个已经过时的偏好和最新偏好并排放在一起,都用现在时描述,会让搜索时误判哪个才是真的。只有明确要求"保留每个事实"才能避免这个问题。
Q3:AI管理记忆的能力强弱,和执行任务时选用的AI能力强弱,哪个更重要?
A:要看具体场景。在对话记忆场景里,负责搜索答案的AI能力强弱直接决定答案质量,而负责整理记忆的AI能力强弱几乎不影响最终答案。但在把经验提炼成技能这类场景里,整理记忆的AI一旦跨过某个能力门槛,提升会非常明显,这时候记忆库里到底写了什么,比执行任务的AI用哪个模型更重要。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.