网易首页 > 网易号 > 正文 申请入驻

给AI装一个不花钱开口的记忆系统

0
分享至


你有没有想过这样一件事:一个每天陪你聊天、帮你处理事情的AI助手,怎么记住你上周提到的那件烦心事?

大部分人以为答案很简单,无非是把聊天记录存起来,需要的时候翻出来看。但真实情况远比这复杂。当对话累积到几百轮、几千条记录之后,AI要在这堆信息里精准地找到跟当前问题相关的那一条,这件事本身就是个技术活。而更让人意外的是,现在主流的做法,是让AI自己再调用一次AI,去把这些记录压缩、总结、提炼成"记忆卡片",然后从卡片里检索。

这就带来一个隐藏很深的问题:每次生成记忆卡片,都要花钱、花时间。而且更麻烦的是,压缩的过程会丢东西。

这篇来自香港理工大学、西南财经大学和吉林大学联合团队的论文,提出了一个听起来有点反常识的方案:能不能让AI的记忆系统完全不用AI来运作?他们把这套方案叫做Zero-Mem,意思是"零token记忆操作"。这篇论文将于2026年发表,目前已挂在arXiv上。

记忆这件事,到底难在哪里

先说说现在流行的做法是什么样的。

市面上大多数AI记忆系统,比如Mem0、A-Mem、Zep这些,核心思路都是"生成式记忆"。什么意思呢,就是当AI跟你聊完一段对话之后,它会再调用一次语言模型,把这段对话总结成一条精简的"记忆条目",存进数据库。下次你问相关问题时,AI去检索的不是原始对话,而是这些被总结过的记忆条目。

这个思路乍一看很合理,压缩之后信息更紧凑,检索起来更快。但问题在于,压缩本身是有损耗的。

**如果两个人的名字很像,或者某个日期在总结过程中被模糊处理,原始细节就可能永远丢失了。**

这就好比你请一个秘书帮你整理会议记录。秘书为了效率,把两小时的会议浓缩成三行摘要。下次你想核实某个具体承诺是谁说的、什么时候说的,翻开这三行摘要,发现里面根本没写清楚,只写了"大家讨论了预算问题"。如果秘书当时把原始录音也留着,你还能翻回去核实;但如果只留了摘要,那些被压缩掉的细节就彻底消失了。而且这个秘书每次开会都要重新写一份摘要,每次都要收一次"服务费"。

另一种做法是干脆不压缩,把所有原始对话都存下来,用普通的关键词或语义相似度检索。这样信息不会丢,但问题是当历史记录足够长、足够杂的时候,同一个关键词可能命中好几个不相关的场景。比如你问"我上次说的那个项目进展如何",系统可能把三个月前提到的一个完全不同项目的对话也翻出来,因为字面上很像。

论文里给出了一组具体数据来说明当前方法的成本有多高。他们测试了三个代表性系统:SimpleMem、LightMem和GAM。在同样的测试条件下,GAM为了完成一次问答任务的记忆操作,总共消耗了2857万个token,平均每个查询要花1.85万个token,记忆操作总耗时超过9237秒。就算是号称"轻量级"的LightMem,也消耗了87万多个token。

**这意味着,每一次AI"想起"一件事,背后都在悄悄烧钱烧时间。**

Zero-Mem想问的问题是:这些开销,是不是根本没必要?

Zero-Mem的核心思路:留住原始证据,不生成中间产物

Zero-Mem最核心的设计理念,是彻底放弃"生成记忆摘要"这一步。

它不会让AI去总结、压缩、改写任何历史对话。所有的原始交互记录,包括用户说的话、AI的回复、工具调用的结果、时间戳、说话人身份,都原封不动地保留下来,作为"记录的唯一权威来源"。

> 溯源性:指信息可以追溯回它最初产生的地方,而不是经过多次转述之后的版本。

这个决定看起来简单,但背后其实是一个价值判断:与其让AI"猜"历史发生了什么(通过读摘要来猜),不如直接把原始证据摆在眼前,让检索系统精确地从中挑出相关的那一部分。

那么问题来了,如果不生成摘要,怎么保证检索足够精准、不会捞出一堆无关信息?

Zero-Mem的答案是,给原始记录建立两套互补的组织结构,一套负责"关系",一套负责"时间"。

### 第一套结构:实体上下文图

Zero-Mem会用一个不需要生成式AI的命名实体识别模型(比如spaCy这种开源工具)去扫描每一段对话,把里面提到的人名、地名、机构名这些实体都识别出来。

> 命名实体识别(NER):一种自动检测文本中人名、地名、机构名等专有名词的技术,不需要大型语言模型,普通的小模型就能完成。

然后,系统会把这些实体和它们出现的上下文段落连起来,形成一张图。如果某个实体在某段对话里出现的频率高,这条连接的权重就更大。相邻的对话段落之间也会建立连接,保证局部的连续性不会被打散。

这张图记录的是"观察到的共现关系",不是AI推断出来的语义关系。换句话说,它只是老老实实地记录"这个人名和那件事出现在同一段话里",不会去猜测"这个人可能和那件事有什么深层联系"。

这套图结构在检索的时候会怎么用呢?

当一个新问题进来,系统先把问题里提到的实体和图里已有的实体做匹配,找到最相似的那个,作为激活的起点。然后通过一种叫"个性化PageRank"的算法,让这个激活信号在图上扩散,越靠近激活起点、越相关的节点会得到越高的分数。

> 个性化PageRank:一种网络传播算法,原本用于网页排序,这里被用来衡量"哪些历史对话片段和当前问题最相关",通过让分数沿着图的连接不断传播来实现。

**这套图结构解决的核心问题是,让分散在不同时间、不同场合提到的同一个人或同一件事,能够被关联起来。**

打个比方,如果你问AI"我提到的那个叫小李的同事,后来项目做得怎么样了",而"小李"这个名字在三个月前的对话里出现过一次,上个月又出现过两次,分别谈了不同的进展。如果没有这张关系图,系统很可能只找到最近一次提到"小李"的对话,漏掉之前的关键信息。有了这张图,系统能顺着"小李"这个节点,把所有相关的对话片段都串起来看。

### 第二套结构:时间层级结构

光有关系图还不够,因为图结构本身不太在乎"先后顺序"和"上下文的连续性"。

Zero-Mem因此又搭了第二套结构,按照时间粒度把对话组织成四层:最细的是"轮次"(一次问一次答),然后是"窗口"(一小段连续对话),再往上是"事件"(一组围绕同一主题的窗口),最后是"局部片段"(某个轮次周围的邻近内容)。

> 时间层级结构:把历史对话按照从细到粗的时间粒度(轮次、窗口、事件、局部片段)组织起来的方式,用来保留对话发生的先后顺序和上下文连续性。

检索的时候,系统会先在"事件"这个粗粒度上找到相关的区域,再逐步细化到"窗口",最后落到具体的"轮次"。如果发现某个轮次需要更多上下文才能理解,系统会自动把它周围的局部片段也带上。

这套结构解决的是另一个问题:有些问题的答案不是靠"关联哪个实体"就能找到的,而是需要知道"这件事发生在什么时间段、什么会话里"。

举个例子,如果你问"我上周三跟AI聊的那件事后来怎么样了",这个问题的关键锚点是"上周三"这个时间点,而不是某个具体的人名或实体。这时候,时间层级结构就比关系图更管用。

**如果只有关系图没有时间结构,系统在处理这类"按时间定位"的问题时会非常吃力,因为图结构天生对时间顺序不敏感。**

反过来说,如果只有时间结构没有关系图,那些需要跨会话关联同一个实体的问题(比如"我提到的那个项目"横跨了好几次对话),就没法把分散的证据串起来。这也是为什么论文的消融实验显示,只用图检索或者只用时间检索,效果都会明显下降。具体来说,在HotpotQA测试里,完整模型的F1分数是72.07,只用图检索降到62.50,只用时间检索更是掉到54.88。这中间差了将近17个百分点,相当于每6个问题里,单一视角的方法就要比完整方案多答错1个。

怎么决定该用哪套结构:查询路由

有了两套互补的结构,接下来的问题是:面对一个具体问题,该优先用哪套?

Zero-Mem给每个查询建了一个轻量级的"画像",里面包含这个问题的主题、关键词、期望的答案类型、时间线索,以及可能的边界限制(比如"只查上个月的对话")。这些信息都是从问题本身和已有的元数据里提取出来的,完全不需要知道正确答案是什么。

> 查询画像:系统对当前问题的结构化理解,包括主题、关键词、答案类型、时间范围等要素,用来决定检索策略。

根据这个画像,系统会判断这个问题更偏向"关系型"还是"局部型"。如果是关系型,图检索的结果会被赋予更高的权重;如果是局部型,时间层级检索的结果权重更高。论文里用一个参数ρ(取值0.6)来控制这个权重分配,两套结构其实都会跑一遍,只是最后融合分数的时候,主视角占更大比重。

这个设计其实很像一个团队里的任务分配。假设你有两个同事,一个擅长梳理人际关系网络,另一个擅长按时间线整理事件进展。遇到问题的时候,你不会让两人各自单干互不干涉,而是先判断这个问题更需要哪种能力,让擅长的那个人主导,另一个人辅助补充。**如果不做这种区分,眉毛胡子一把抓,两套结构的优势反而会互相稀释。**

证据闭合:把碎片证据拼成完整拼图

光找到相关的候选证据还不够,因为很多问题的答案不是单独一条记录能回答的,而是需要把几条分散的证据拼在一起。

Zero-Mem在这一步引入了"证据闭合"的机制。它先把图检索和时间检索的结果做归一化处理,让两套打分体系可以放在同一个尺度上比较,然后按照前面提到的权重ρ融合成一个统一的分数。

融合之后得到的"主证据",还会被进一步补充。系统会从图结构里找一些"桥接"证据,也就是和主证据有关系连接但本身没被直接检索到的内容;也会从时间结构里找一些"邻近"证据,把主证据周围的对话轮次也带上。

这一步为什么重要?

因为很多复杂问题的答案,证据是分散在好几个地方的,单靠一次检索命中的那几条记录,往往缺了拼图里的某一块。证据闭合就是专门去补这些缺口。

打个比方,你去查一起案件的来龙去脉,直接搜到的可能只是案发现场的报告,但案件的动机可能记录在另一份完全不相关的文件里,你得靠"这个人和那个人有关系"这条线索,才能把两份文件联系起来。证据闭合做的就是这种补漏工作,如果没有这一步,很多需要跨记录关联的问题就会因为证据不全而答错。实验数据显示,去掉证据闭合这一步,F1分数从72.07降到67.90,少了4个多百分点。

确定性校准:不用AI也能查漏补缺

最后一步,是对拼好的证据集合和AI给出的答案做"校准"。

这里有个关键点:整个校准过程,不管是对证据的过滤排序,还是对最终答案的检查,全部都是"确定性"的规则判断,不需要再调用一次AI。

> 确定性校准:通过预先设定好的规则(比如"这条证据是否符合问题的时间范围""答案类型是否匹配")来筛选和修正结果,而不是依靠AI模型的判断。

具体来说,系统会先根据查询画像里的主题、时间、答案类型等信息,把不符合硬性约束的候选证据过滤掉,剩下的按相关性排序,组成最终喂给AI阅读器的证据集合。

到这一步,才轮到唯一一次真正调用大语言模型:让AI阅读器基于这些证据生成答案。

生成答案之后,系统还会做最后一道检查。如果问题的答案类型是可以用规则判断的(比如答案应该是一个具体的数字、日期,或者是从证据里能直接摘取的片段),系统会从证据里提取候选答案,和AI生成的答案做比对。如果AI给出的答案有证据支持、格式也对,就保留;如果不对,系统会用证据里更靠谱的候选项做替换,或者做一些提取式的精简处理。

**整个流程里,从证据组织、检索、到证据校准和答案校准,全程没有一次AI调用,只有最后生成答案这一步用到了大语言模型。**

这就是"零token记忆操作"这个说法的由来。

实验结果:省钱省时间,效果还更好

理论讲得再漂亮,最终还是要看效果。论文在两个基准测试集上做了验证。

第一个是LoCoMo,专门用来测试AI对长期多轮对话的记忆能力,题型分为单跳(直接查一个事实)、多跳(需要串联多条信息)、时间推理、开放域问答四类。

在GPT-4o-mini作为基础模型的设置下,Zero-Mem的平均F1得分是59.15,平均BLEU-1是52.96,都是所有对比方法里最高的。第二名是GAM,平均F1是53.75,Zero-Mem比它高出5.4个百分点。在Qwen2.5-14B的设置下,Zero-Mem同样拿到了所有题型、所有指标里的第一名。

第二个测试集是HotpotQA,专门考验在超长上下文(56K到448K token)里定位分散证据的能力。结果显示,Zero-Mem在所有上下文长度、所有基础模型的组合下,F1分数都是最高的,在最难的448K token设置下,平均比最强对手高出5.52个百分点。

| 方法 | F1得分 | BLEU-1 | 消耗token | 每查询耗时(秒) |

| SimpleMem | 48.02 | 41.68 | 14,096,246 | 5.43 |

| LightMem | 38.44 | 34.36 | 877,086 | 0.51 |

| GAM | 53.75 | 47.51 | 28,570,674 | 6.00 |

| **Zero-Mem** | **59.15** | **52.96** | **0** | **0.22** |

这张表格里最扎眼的一列,是Zero-Mem的token消耗直接是0。这不是四舍五入的0,是真的一个token都没花在记忆操作上。而效率方面,Zero-Mem每处理一个查询只需要0.22秒,比目前最快的LightMem(0.51秒)还要快57.6%。

需要澄清一点,"零token"不等于"零计算"。Zero-Mem依然要跑实体识别模型、要做向量检索、要执行PageRank这类算法,这些都需要计算资源,只是这些计算不经过大语言模型,不产生token费用。

**换句话说,省下来的不是计算量,而是那笔本可以避免的"AI调用税"。**

检索数量的影响:5条证据够不够用

论文还专门做了一个实验,看给AI阅读器提供多少条证据最合适。

结果显示,从只给1条证据提升到给5条,平均F1和BLEU-1有明显跃升,分别从52.59和46.79涨到59.15和52.96。继续加到10条,效果达到峰值,但再往上加到15条、20条,效果基本不再提升,甚至略有波动。

不同题型的"胃口"还不太一样。单跳问题只需要少量证据就够了,而多跳、时间推理、开放域这类需要综合多方面信息的问题,更依赖充足的证据覆盖面。

论文最终选择了给5条证据作为主实验配置,主要是为了和其他基线方法保持一致的对比条件。用5条相比用10条,只损失了0.65个F1点和0.83个BLEU-1点,但检索的候选数量减了一半,性价比更高。

写在后面

读完这篇论文,最让我意外的一点是,大家一直默认"记忆系统要智能,就得让AI参与整理",但Zero-Mem用实打实的数据证明,这个默认假设本身可能是错的。GPT-4o-mini设置下平均F1能到59.15,比用了大量LLM调用的GAM(53.75)还高,而且是在完全不消耗记忆操作token的前提下做到的。这说明"智能"未必要靠生成式模型来实现,一套设计得当的非生成式结构,配合确定性规则,可能比"让AI自己去总结再自己去理解"更靠谱。

还有一个细节值得单独说一下:论文里提到,生成式摘要会"blur"(模糊)一些关键的时间更新和主体信息,这在处理时间推理类问题时特别致命。这也解释了为什么Zero-Mem在时间推理题型上的领先幅度格外大(GPT-4o-mini设置下F1从59.45涨到61.97,Qwen2.5-14B设置下从51.52涨到58.34)。压缩这件事,代价往往出现在你最不注意的细节里。

如果记忆系统真的可以不依赖生成式AI来运作,那接下来的问题是:检索系统之外,还有哪些环节其实也是被生成式AI"绑架"的,是不是也存在同样便宜且更靠谱的替代方案?

Q&A

Q1:Zero-Mem是什么?

A:Zero-Mem是港理工、西南财大等团队联合提出的一种AI智能体记忆系统,它的核心特点是除了最后回答问题这一步,记忆的组织、检索、校准全过程都不调用大语言模型,不消耗任何LLM token。

Q2:Zero-Mem和Mem0、GAM这些记忆系统比,效果怎么样?

A:在LoCoMo和HotpotQA两个基准测试上,Zero-Mem的准确率(F1、BLEU-1)都超过了Mem0、GAM、SimpleMem等主流方法,同时记忆操作耗时比最快的对比方法还少57.6%,token消耗直接为零。

Q3:Zero-Mem为什么不用AI生成记忆摘要,而是保留原始对话?

A:因为生成摘要的过程会造成信息损耗,比如模糊时间细节、合并相似主体,这对需要精确追溯的问答任务是致命的。Zero-Mem保留原始记录,通过实体关系图和时间层级结构做非生成式的精准检索,既避免信息丢失,也省去了重复调用AI的成本。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1950年,很少发火的陈赓,听到女兵评价他的千金时:谁敢这么说?

1950年,很少发火的陈赓,听到女兵评价他的千金时:谁敢这么说?

简史档案馆
2026-08-19 11:05:03
范·迪塞尔与保罗·沃克之女重逢!硬汉哽咽:她是在父亲节给我打电话的人

范·迪塞尔与保罗·沃克之女重逢!硬汉哽咽:她是在父亲节给我打电话的人

娱乐嗑学家.
2026-08-19 12:34:30
毕夏首谈丈夫离世:“我说,老公,你已经很棒了,如果你太遭罪的话就走吧”

毕夏首谈丈夫离世:“我说,老公,你已经很棒了,如果你太遭罪的话就走吧”

韩小娱
2026-08-19 16:08:22
日媒终于慌了:中方连照面都不认了

日媒终于慌了:中方连照面都不认了

娱乐的宅急便
2026-08-19 07:18:52
一脸油腻,表情狰狞,却硬在央视大剧演刑警,网友:真不害臊吗?

一脸油腻,表情狰狞,却硬在央视大剧演刑警,网友:真不害臊吗?

洲洲影视娱评
2026-08-19 13:23:27
全球公关总监因车祸离世,Dior软实力面临交接考

全球公关总监因车祸离世,Dior软实力面临交接考

观察者网
2026-08-19 19:22:51
中一签赚47.46万,宇树科技开盘暴涨629.44%,王兴兴成90后新首富

中一签赚47.46万,宇树科技开盘暴涨629.44%,王兴兴成90后新首富

红星资本局
2026-08-19 10:30:06
男子按摩店选了最贵的套餐,老板娘亲自服务4小时后,一言难尽

男子按摩店选了最贵的套餐,老板娘亲自服务4小时后,一言难尽

皮蛋儿电影
2026-07-24 09:40:33
赵海峰猥亵事件更多细节曝光,还牵扯出更多位大人物

赵海峰猥亵事件更多细节曝光,还牵扯出更多位大人物

社会日日鲜
2026-08-19 13:35:57
谌贻琴调研第20届亚运会备战工作:坚持祖国至上、为国争光

谌贻琴调研第20届亚运会备战工作:坚持祖国至上、为国争光

上观新闻
2026-08-19 19:56:07
瓜迪奥拉一句几乎完美,把西甲冠军悬念提前钉死?罗德里驾临诺坎普,皇马这次真慌了

瓜迪奥拉一句几乎完美,把西甲冠军悬念提前钉死?罗德里驾临诺坎普,皇马这次真慌了

林子说事
2026-08-19 09:43:36
气质女神:那不是装扮,是我在空间中为自己留出的视线缓冲区

气质女神:那不是装扮,是我在空间中为自己留出的视线缓冲区

疾跑的小蜗牛
2026-08-19 19:19:03
韩国瑜陷困境,郑丽文无心理,“党主席保卫战”已提前打响

韩国瑜陷困境,郑丽文无心理,“党主席保卫战”已提前打响

叮当当科技
2026-08-19 14:39:46
曼联因安东尼转会告吹痛失超千万欧 50%二次分成落空

曼联因安东尼转会告吹痛失超千万欧 50%二次分成落空

快乐加载中21
2026-08-19 19:32:37
A股:早盘突大开跳水破3920,种种迹象表明,A股熊市已宣告开始了吗?

A股:早盘突大开跳水破3920,种种迹象表明,A股熊市已宣告开始了吗?

趋势清风侠
2026-08-19 10:23:34
虚构地铁“诡异事件”,博眼球式带货不可纵容| 新京报快评

虚构地铁“诡异事件”,博眼球式带货不可纵容| 新京报快评

新京报
2026-08-18 18:46:11
中印一旦公开宣战,战争规模会有多大?印专家:印度在10天内必败

中印一旦公开宣战,战争规模会有多大?印专家:印度在10天内必败

梁濆爱玩车
2026-08-14 19:11:41
遥拜神社闯下大祸!美国罕见翻脸表态,高市相位摇摇欲坠

遥拜神社闯下大祸!美国罕见翻脸表态,高市相位摇摇欲坠

小嵩
2026-08-19 09:55:48
不得不说绑带高跟凉鞋,穿起来确实很有魅力

不得不说绑带高跟凉鞋,穿起来确实很有魅力

美女穿搭分享
2026-08-18 16:27:54
超5000家下跌,逾百股跌停!A股发生了什么?明天如何应对?

超5000家下跌,逾百股跌停!A股发生了什么?明天如何应对?

每经牛眼
2026-08-19 15:56:19
2026-08-19 20:51:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9587文章数 568关注度
往期回顾 全部

科技要闻

宇树的悬念还在后面

头条要闻

结婚8年发现三娃均非亲生 男方已将孩子全部送还女方

头条要闻

结婚8年发现三娃均非亲生 男方已将孩子全部送还女方

体育要闻

拥有“儿皇梦”的罗德里,为何选择巴萨?

娱乐要闻

章子怡财路遭到质疑,套现3亿冲上热搜

财经要闻

内部反腐,让大疆错过宇树250亿收益?

汽车要闻

小米澎程N70体验 后排空间夸张亦可旋转对坐

态度原创

教育
旅游
本地
手机
数码

教育要闻

不确定自家的小朋友是否真的能做出来,毕竟条件太少了

旅游要闻

西藏班戈:羌塘明珠色林错

本地新闻

邂逅活珊瑚的西沙,感受独属于国人的浪漫

手机要闻

512GB只有32GB!山寨机死灰复燃,华为小米苹果集体躺枪了

数码要闻

9499元!雷神黑武士猎刃Pro水冷台式机开售:酷睿7 230H+RTX 5060 Ti

无障碍浏览 进入关怀版