网易首页 > 网易号 > 正文 申请入驻

给AI装上记忆,它就真的记对了吗?HaluMem拆解智能体记忆幻觉

0
分享至



当 AI 助手把你的新职位说错时,我们很容易把它归结为:模型又在「胡说八道」。

但错误一定发生在回答的那一刻吗?

想象一下,你已经告诉助手自己刚刚升职。它可能在整理对话时就记错了职位,也可能保留着旧记录、没有完成更新,还可能拿到了正确记忆,却在回答时换成另一个头衔。最后呈现给用户的,都是一句错误答案。

同样是「答错」,背后却可能是完全不同的记忆故障。

中国电信研究院与上海记忆张量( MemTensor )公司等研究者围绕这一问题提出了HaluMem:首个面向智能体记忆系统的操作级幻觉评测基准。它将评测深入到记忆提取、记忆更新和记忆问答三个环节,追踪错误究竟在哪里产生,以及如何影响后续回答。

该工作已被自然语言处理领域顶级会议EMNLP 2026 主会接收。

如果一本笔记在写入时就记错了,之后再熟练地翻阅,也可能只是更准确地找回错误。要判断 AI 的记忆是否可靠,我们需要检查这本「笔记」是怎么写成、怎么修改、又怎么被使用的。



  • 论文题目: HaluMem: Evaluating Hallucinations in Memory Systems of Agents
  • 作者: Ding Chen、Simin Niu、Kehang Li、Peng Liu、Xiangping Zheng、Bo Tang、Xinchi Li、Feiyu Xiong、Zhiyu Li
  • 开源项目: https://github.com/MemTensor/HaluMem
  • arXiv 论文:https://arxiv.org/pdf/2511.03506

1. 一个被最终答案遮住的问题:

AI 是答错了,还是早就记错了?

记忆系统让 AI 能够在一次次对话之间保留用户信息:你从事什么工作、喜欢什么、最近经历了哪些变化。可一条信息从聊天记录走向最终回答,中间还要经历提取、存储、更新和检索。

现有记忆评测主要采用端到端问答:给系统输入一系列对话,再提出问题,比较回答与标准答案。这能衡量系统最后答得怎么样,却很难说明它为什么答错。

HaluMem 的切入点,是为中间操作也提供可以核对的标准答案。



图 1:HaluMem 与现有评测方式的对比。除了检查最终回答,还要检查记忆在提取和更新时是否已经发生偏差。(论文图 2)

例如,用户说「我最近开始喜欢鹦鹉了,以前确实不喜欢」,系统却提取成「用户不喜欢鹦鹉」。错误已经发生在写入记忆的第一步。再如,用户明确表示健康状况变差,系统却按照助手的错误回忆,将健康状态更新为「良好」。即使后续检索没有出错,回答也已经建立在错误记录之上。

还有一种更隐蔽的情况:助手自己编出的细节,被记忆系统当成了用户事实。 对话中,AI 可能顺口提到一个并不存在的朋友或经历;用户没有明确确认,系统却把它存进了长期记忆。一次未经证实的表达,就可能成为下一次回答的「依据」。

因此,HaluMem 分别检查三个问题:

  • 记忆提取:该记的信息是否被完整、准确地记录?有没有把虚构细节也写进去?
  • 记忆更新:新信息出现后,旧记忆是否得到正确修改?有没有漏改、改错或留下冲突?
  • 记忆问答:系统最终能否利用记忆给出正确回答?错误回答与因信息缺失而无法回答,各占多少?

这些检查按对话时间顺序展开,在相关会话处理完成后立即触发。由此,评测不再只得到一个总分,还能看到不同操作阶段的具体问题。

2. 给 AI 一段跨越十余年的「人生」,

再加入百万 token 的干扰

要检查记忆有没有出错,首先需要知道:在每一个时刻,系统究竟应该记住什么?

真实聊天记录往往缺少这样的完整标注。用户的偏好会改变,旧信息会过时,有些事实还藏在上下文里。仅在对话结束后补几个问答,很难还原整条记忆演变过程。

HaluMem 为此设计了一条以用户为中心的六阶段数据构建流程:从用户画像出发,建立人生发展骨架,再展开为事件流,生成对应的会话摘要和记忆点,最后生成多轮对话与评测问题。



图 2:HaluMem 的六阶段构建流程。从用户画像、人生骨架和事件流出发,将应记录的记忆点与实际对话、评测问题关联起来。(论文图 3)

这套流程模拟了跨度为10—20 年的用户经历。职业变化、健康状态、兴趣偏好和人际关系沿着时间推进,形成画像、事件、关系三类记忆。发生更新时,数据保留新旧信息的对应关系,让「该怎么改」也有据可查。

生成对话时,研究者还加入了助手误引或虚构细节等干扰,以及隐含表达和指代。系统既要找到值得保存的信息,也要判断哪些说法没有得到用户确认。

在此基础上,HaluMem 提供两个版本:

  • HaluMem-Medium:覆盖 20 位用户,共 30,073 轮对话,平均每位用户约 16 万 tokens,包含 14,948 个记忆点和 3,467 个问答。
  • HaluMem-Long:保留相同的有效记忆,在会话内部和会话之间插入无关对话,将每位用户的上下文扩展到百万 token 量级,总对话数达到 53,516 轮。

这组设计的关键在于:Long 版本主要增加的是干扰与上下文负担,而不是需要记住的核心事实。 因而,两组结果的差异可以帮助观察系统能否在更长、更嘈杂的交互中持续保留有效信息。

问题也不只考「记没记住」。六类问答覆盖基础事实回忆、多跳推理、动态更新、记忆边界、泛化与应用、记忆冲突。例如,既要知道用户现在的状态,也要识别问题中的错误前提,或承认某条信息从未被提供。

为检查数据质量,研究者对 Medium 中的700 段会话进行了人工评估,覆盖超过一半的会话,并核查其中的记忆点与问答。人工检查得到的正确率达到95.70%。

3. 六套系统实测:

记得多、改得少,都可能掩盖问题

研究评测了 Mem0、Mem0-Graph、Memobase、MemOS、Supermemory 和 Zep 六套记忆系统,并在两种上下文规模下分别测试。

为统一评测条件,更新任务检索前 10 条相关记忆进行核验,问答任务检索前 20 条记忆,并统一使用 GPT-4o 生成答案。以下数值均来自论文主实验设置;Zep 因其官方接口无法获取会话级的记忆提取记录,未报告记忆提取指标。



表 1:六套系统在记忆提取、更新和问答任务上的结果。将多个指标放在一起,才能区分信息覆盖、内容正确性与遗漏问题。(论文表 3)

发现一:记下了更多内容,不代表记忆更可靠

在 Medium 上,Mem0 和 Mem0-Graph 的记忆召回率分别为42.91% 和 43.28%,Memobase 为14.55%。也就是说,相当一部分应该被记住的信息,在提取阶段就没有被完整保留下来。

上下文扩展到 Long 后,三者的召回率进一步降至3.23%、2.24% 和 6.18%。核心记忆没有改变,仅仅增加无关对话,就足以让部分系统漏掉绝大多数目标信息。

但另一端也有难题。MemOS 在 Long 上的召回率达到81.90%,Supermemory 达到53.02%;二者覆盖了更多目标记忆,同时也暴露出干扰过滤不足的问题。

HaluMem 用虚假记忆抵抗能力(False Memory Resistance,FMR)衡量系统能否忽略那些由助手提及、却未经用户确认的干扰记忆。该指标越高越好。在 Long 上,MemOS 和 Supermemory 的 FMR 分别为28.85% 和 36.86%。

这意味着,扩大信息覆盖并没有自动带来更强的真假辨别能力。

可靠记忆需要同时做到两件事:该记的不能漏,不该信的不能存。单看召回率或记忆条数,都容易忽略另一侧的代价。

发现二:更新幻觉率不到 1.2%,为什么仍然不可靠?

如果只看更新幻觉率,结果似乎相当乐观:主实验中,所有系统在两个版本上的这一指标都低于 1.2%。

但把遗漏率放在旁边,情况就完全不同了。

在 Long 上,六套系统中有五套的更新遗漏率超过60%。其中,Mem0 和 Mem0-Graph 分别达到98.51% 和 98.40%,对应的正确更新率仅为1.45% 和 1.47%。MemOS 的正确更新率最高,为65.25%,但仍遗漏了约三分之一的目标更新。

为什么「很少改错」会和「大量漏改」同时出现?

因为更新幻觉率衡量的是目标更新中发生错误更新的比例。当大量更新根本没有完成时,错误更新的比例也可能很低。 仅凭这一项数值,无法判断系统是否真正掌握了记忆更新。

而且,更新还依赖前面的提取:如果旧事实从未被存入记忆,后续就缺少可以更新的对象。操作级评测因此揭示了一个重要关联 —— 更新不足,可能从记忆第一次写入时就已经开始。

发现三:上游记忆的问题,最终会出现在回答里

在统一问答设置下,所有受测系统的正确率均未达到70%。MemOS 在 Medium 和 Long 上分别达到67.23% 和 64.44%,为两组最高值,但距离稳定可靠仍有明显空间。

对部分系统而言,长上下文带来的下降尤其突出。Mem0 的问答正确率从53.02% 降至 28.11%,同时,问答遗漏率从27.81% 升至 54.60%。这一变化与其上游记忆召回率的大幅下降相呼应。



图 3:六套记忆系统在六类题型上的回答准确率,分别展示其在 两个评测集上的表现。不同题型用于考察系统在不同记忆使用场景下的回答能力,以及长上下文对各类能力的影响。(论文图 5)

不同题型还揭示出能力差异:多数系统在识别未知信息或错误前提时表现相对较好,但面对多跳推理、动态更新和泛化应用,仍然存在明显短板。

最终答案是整条记忆处理过程的共同产物。想改善回答,需要同时检查事实是否被记下、变化是否被更新,以及检索出的信息能否被正确使用。

论文还随机抽取 10 位用户,使用 GPT-5.4-mini 替换主实验裁判进行复评。具体分数有所变化,但记忆系统的整体排名、主要表现趋势、提取覆盖与干扰抵抗之间的取舍,以及更新遗漏严重等核心发现保持一致。

4. 从「能记住」到「记得可靠」,还缺什么?

HaluMem 带来的价值,是让记忆系统的改进方向变得更具体。

如果问题在提取,就要同时检查信息覆盖和来源可信度;如果问题在更新,就要检查新旧记忆的关联,以及应做的修改是否真正完成;如果问题出现在问答,则需要结合上游记录与检索结果继续分析。

这也解释了为什么一项漂亮的单独指标还不够:高召回可能伴随虚假信息写入,低更新幻觉率可能伴随大量遗漏,而最终问答分数则可能遮住内部不同环节的失败。

当然,目前这项工作仍有未来可扩展的方向。当前数据围绕模拟用户的画像、事件和关系记忆展开,尚未全面覆盖工具、技能等其他记忆形态;不同系统开放的接口,也会影响内部操作的可观测程度。

但它已经提供了一种可复用的评测思路:把最终答案背后的记忆操作逐一拿出来核对,让「哪里出了错」成为可以测量的问题。

回到开头那个把新职位说错的助手。下一次,我们除了问「为什么又答错了」,还可以继续追问:这条信息最初记对了吗?升职之后改过了吗?回答时用的是哪一条记录?

当这些问题能够被逐一回答,AI 距离真正可靠的长期记忆,才有了更清楚的改进路径。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中央批准,王云鹏履新职

中央批准,王云鹏履新职

新京报
2026-09-30 11:00:07
惠英红发文称团队在巴黎堵车,等待时被人直接砸破车窗抢走包

惠英红发文称团队在巴黎堵车,等待时被人直接砸破车窗抢走包

大风新闻
2026-09-30 16:03:02
真来了!特斯拉中国全新 Model 3 即将发布

真来了!特斯拉中国全新 Model 3 即将发布

XCiOS俱乐部
2026-09-30 13:33:54
国足亚运队1-2遭韩国逆转无缘决赛,王钰栋建功,裴峻浩绝杀

国足亚运队1-2遭韩国逆转无缘决赛,王钰栋建功,裴峻浩绝杀

懂球帝
2026-09-30 16:00:52
领先日本100金!亚运会最新奖牌榜更新,中国队金牌数太夸张

领先日本100金!亚运会最新奖牌榜更新,中国队金牌数太夸张

宗介说体育
2026-09-30 15:10:15
易会满,受贿数额特别巨大

易会满,受贿数额特别巨大

新京报
2026-09-30 10:18:52
林诗栋夺冠动了谁的利益?秦志戬举动遭质疑,王楚钦被批评输不起

林诗栋夺冠动了谁的利益?秦志戬举动遭质疑,王楚钦被批评输不起

三十年莱斯特城球迷
2026-09-30 11:52:59
进价6元/米 卖60元/米!燃气公司强制搭售波纹管 不买就停气

进价6元/米 卖60元/米!燃气公司强制搭售波纹管 不买就停气

闪电新闻
2026-09-30 12:52:42
安东尼奥:球员拼尽全力,就算输球也可以昂首挺胸离开球场

安东尼奥:球员拼尽全力,就算输球也可以昂首挺胸离开球场

澎湃新闻
2026-09-30 17:04:03
震惊!江苏泗洪一女孩出嫁,娘家千万陪嫁:爸妈588万,大哥二哥三哥各100万,黄金680克,外加保时捷、洋房

震惊!江苏泗洪一女孩出嫁,娘家千万陪嫁:爸妈588万,大哥二哥三哥各100万,黄金680克,外加保时捷、洋房

火山詩话
2026-09-29 15:02:00
易会满,敛财数额特别巨大

易会满,敛财数额特别巨大

政知新媒体
2026-09-30 10:14:19
甩日本98金!9月29日收官,最新金牌榜洗牌:中国霸榜,黑马诞生

甩日本98金!9月29日收官,最新金牌榜洗牌:中国霸榜,黑马诞生

大秦壁虎白话体育
2026-09-29 22:03:03
现在,轮到武汉文旅尴尬了

现在,轮到武汉文旅尴尬了

神不隆通
2026-09-30 10:39:26
日本媒体气疯了!要求处罚林诗栋,国际乒联却把这张图做成了封面

日本媒体气疯了!要求处罚林诗栋,国际乒联却把这张图做成了封面

旧史新谭
2026-09-29 20:13:13
中国人民银行将开展12000亿元买断式逆回购操作

中国人民银行将开展12000亿元买断式逆回购操作

界面新闻
2026-09-30 17:04:16
内塔尼亚胡发表视频声明:“别惹我们”

内塔尼亚胡发表视频声明:“别惹我们”

政知新媒体
2026-09-30 01:15:42
东航空姐下跪道歉上热搜!被餐车碰了一下手肘,空姐被逼下跪两三次

东航空姐下跪道歉上热搜!被餐车碰了一下手肘,空姐被逼下跪两三次

派大星纪录片
2026-09-30 16:33:30
无缘决赛!国足1-2韩国 球员评分:1人高分 4人不及格 揪出最差之人

无缘决赛!国足1-2韩国 球员评分:1人高分 4人不及格 揪出最差之人

侃球熊弟
2026-09-30 15:55:12
张雪称赞“特别漂亮”的浙江老板娘要IPO了,17年前她破格录用这位机车少年

张雪称赞“特别漂亮”的浙江老板娘要IPO了,17年前她破格录用这位机车少年

都市快报橙柿互动
2026-09-30 00:33:17
22岁女子指控遭美国常春藤名校7名男生下药性侵,事情过去近两年无一人被捕,最新进展:案件重启刑事调查

22岁女子指控遭美国常春藤名校7名男生下药性侵,事情过去近两年无一人被捕,最新进展:案件重启刑事调查

都市快报橙柿互动
2026-09-30 00:59:14
2026-09-30 17:44:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14113文章数 142740关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

国足主教练回应不敌韩国:我们被在欧洲踢球的对手压制

头条要闻

国足主教练回应不敌韩国:我们被在欧洲踢球的对手压制

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

胡歌现身游本昌遗体告别仪式

财经要闻

中央财政首次贴息房贷 定向支持首套刚需

汽车要闻

华为乾崑ADS 5上车 纵横G700限时权益价30.49万起

态度原创

手机
本地
旅游
健康
公开课

手机要闻

请更新:苹果iOS/iPadOS 26.7.1修复漏洞,恶意文件可触发代码执行

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

旅游要闻

假期,就去北京这里摘板栗!

刷酸祛痘,为什么有人翻车?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版