网易首页 > 网易号 > 正文 申请入驻

AI用3年时光,来了解你!首个AI Clone长期记忆基准

0
分享至


新智元报道

编辑:LRST

【新智元导读】现有AI记忆评测存在局限,如数据源单一、忽视变化本质、注入成本高等。CloneMem通过层次化生成框架构建合成人生,设计贴近真实场景的评测任务,涵盖多种问题类型。实验发现简单方法在检索上更有效,复杂系统会丢失关键细节,记忆系统应保留细节和时间脉络,还原而非压缩信息,以更好地理解人。

AI数字分身正在从科幻走向现实帮你回邮件、管理日程,甚至可以直接替你和别人coffee chat。

但问题是:AI如何深度了解并与你保持同步

不仅要「知道」你叫什么,住在哪里,喜欢听什么音乐,喜欢吃什么,更要「持续了解」:这几年你经历了什么、你的想法是如何一步步转变的、为什么去年你想要跳槽,但今年却想要留下。

这些,才真正定义了你是谁。

针对这一问题,开源学术社区QuantaAlpha联合国内外知名高校团队提出了CloneMem——首个专门评估AI Clone长期记忆能力的基准测试,并提供了中英文双语版本


论文链接:https://arxiv.org/pdf/2601.07023

代码数据:https://github.com/AvatarMemory/CloneMemBench


AI Clone 应用场景示意图

人生的关键变化

往往不发生在聊天框里

现有AI记忆评测主要考察模型能否记住用户与AI之间说过的话。但这套评测范式存在三个根本局限:

数据源单一。

仅依赖用户与AI的对话记录,而这些记录往往只反映了生活中的某些片段。更关键的是,对话内容高度依赖用户主动表达,本身就已经经过个人的二次叙述,很难还原一个人真实而连续的生活轨迹。

忽视「变化」的本质。

现有基准关注的是「AI 能否记住某个事实」,而非「AI 能否理解这个人是怎么一步步变成现在这样的」——经历如何塑造情绪,情绪如何影响观点,观点又如何左右选择。

注入成本高。

想让AI了解你,你得不断主动和它聊。但谁有时间每天给AI写日记?这种机制难以长期维持。


CloneMem与现有记忆评测基准对比

数据怎么造?

层次化生成一个合成人生

真实用户数据涉及隐私,研究团队设计了一套层次化生成框架:

宏观层面,基于大五人格初始化人物设定,构建职业、家庭、情绪、价值观等长期人生弧线;中观层面,将每个重大事件拆分为多个阶段,维护内部状态快照(能量、压力、情绪、关注焦点),状态在阶段间传递以保证连贯性;微观层面,为每个阶段生成具体事件,并同步产出日记、帖子、消息等多种媒介内容。

这种自顶向下的设计确保了经历、情绪、观点在长时间跨度上保持一致。


CloneMem 完整的数据构建流程

面向真实交互场景的评测任务设计

CloneMem设计了一系列贴近真实使用场景的评测任务。所有问题都从「与AI Clone聊天的朋友」视角出发,而不是系统自问自答。

提问者像现实中的熟人一样,会在不同时间点向AI Clone询问你的近况和想法。

更关键的是,这些问题不是集中在某一个时间段,而是贯穿在你完整的人生时间线上,这也就意味着模型需要在横跨数年的日记、社交媒体、聊天记录和邮件等多源记录里,找到关键信息,并理解经历如何影响情绪,情绪如何塑造观点,观点又如何推动选择,才能做出正确的判断。


CloneMem评测任务示例

CloneMem设计了7种问题类型,涵盖了事实回忆、规律识别、变化对比、长期轨迹理解、因果推理、反事实推理,以及无法回答的情况。

而考虑到在真实场景下的开放式问答难度不低,CloneMem也为每道简答题设计了对应的选择题版本,用来降低难度。

实验发现

简单方法反超,复杂系统压缩掉关键细节

研究团队从检索能力、记忆有效性和回答一致性等多个维度,对Flat Retriever、A-MEM和Mem0三种记忆系统进行了评估,结果却有些出人意料。

在检索层面,简单方法反而更有效

在多数指标上,最简单的Flat Retriever表现最好。原因是抽象和总结虽然有助于搜索,但会损失细节保真度。而AI Clone任务高度依赖时间顺序、原始表述、事件间的细微关联,而这些信息往往在摘要的过程中被压缩掉了。


不同记忆系统的 QA 性能与记忆效用对比(Oracle 为使用真实上下文的上界)

在表征层面,记忆系统只记事件,而不记状态

以老沈为例,他正在经历中年危机,连续两周在凌晨浏览招聘网站,搜索各种岗位信息。记忆系统非常诚实的记下了这些行为,但无法表征他还在犹豫,一份简历都没投出去的状态。

因此当被问到老沈有没有看重的公司时,模型面对一堆求职相关的行为记录,自然会脑补出老沈看重了几家公司,然而实际上,他什么都没有决定。

在生成层面,模型容易被叙事惯性所带偏

即使检索到了正确的信息,模型仍然倾向于套用高概率叙事模板,而并没有依据事实证据。比如当问老沈为什么愿意向妻子敞开心扉,正确答案是他意识到长期强撑正在伤害家庭,模型却回答女儿的一幅画触动了他,这听起来很合理,但证据完全对不上。

对记忆系统设计的启示

CloneMem的实验结果指向一个核心问题:当前的记忆系统把记住当成了目标,但AI Clone真正需要的是还原。

这意味着记忆系统不能只做信息压缩,而要保留原始表述和时间脉络;不能只记发生了什么事,还要能表征一个人正在经历什么阶段;不能总是给出答案,而要在证据不足时学会说不知道。

换句话说,AI Clone的记忆不应该是一个越压越小的知识库,而应该是一个保留完整证据链的底座,因为理解一个人,靠的不是摘要,而是细节。

QuantaAlpha

QuantaAlpha成立于2025年4月,由来自国内外知名院校的老师和学生组成,使命是探索智能的「量子」,引领智能体研究的「阿尔法」前沿,从CodeAgent到自进化智能,再到金融与跨领域专用智能体,致力于重塑人工智能的边界。

2026年,研究团队将在CodeAgent、DeepResearch、Agent Memory、Agentic Reasoning/Agentic RL、自进化与协同学习等方向持续产出高质量研究成果,欢迎对我们方向感兴趣的同学加入我们!


团队主页:https://quantaalpha.github.io/

参考资料:

https://arxiv.org/pdf/2601.07023


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
哈登30+6+8加盟新高!骑士难阻魔术5连胜 贝恩35+6+6米切尔25分

哈登30+6+8加盟新高!骑士难阻魔术5连胜 贝恩35+6+6米切尔25分

醉卧浮生
2026-03-12 10:20:51
理记曝光张艺兴事件内幕:屡次出国不报备,竟靠孙红雷才找到人?

理记曝光张艺兴事件内幕:屡次出国不报备,竟靠孙红雷才找到人?

魔都囡
2026-03-12 09:46:00
伊朗人为何不惊慌?

伊朗人为何不惊慌?

西楼饮月
2026-03-11 20:59:17
河北保定17岁店员被70岁老人殴打,连扇5巴掌,顾客劝架也被打

河北保定17岁店员被70岁老人殴打,连扇5巴掌,顾客劝架也被打

180视角
2026-03-12 10:31:00
太猖狂!上海一男子12345举报违建,自己和家人信息被秒泄!被举报人:只要我想知道,什么途径都可以,你明白吧?

太猖狂!上海一男子12345举报违建,自己和家人信息被秒泄!被举报人:只要我想知道,什么途径都可以,你明白吧?

纵相新闻
2026-03-11 13:00:10
女生去看病登机被拒后续:视频流出,女子痛哭恳求航空公司被骂惨

女生去看病登机被拒后续:视频流出,女子痛哭恳求航空公司被骂惨

奇思妙想草叶君
2026-03-11 16:25:13
实锤!美媒给出美军“战斧”袭击伊朗小学证据

实锤!美媒给出美军“战斧”袭击伊朗小学证据

新华社
2026-03-09 15:34:17
被炸1401次远超以色列!伊朗为何猛攻阿联酋?

被炸1401次远超以色列!伊朗为何猛攻阿联酋?

网易新闻出品
2026-03-11 17:00:21
使用过时情报?美军内部调查初步认定“误炸”伊朗小学

使用过时情报?美军内部调查初步认定“误炸”伊朗小学

界面新闻
2026-03-11 23:52:52
5万人口小城的奇迹!欧冠超级黑马狂飙:3-0 5连胜 奔向8强

5万人口小城的奇迹!欧冠超级黑马狂飙:3-0 5连胜 奔向8强

叶青足球世界
2026-03-12 08:53:27
网传某车企疑似“养龙虾”致员工电脑集体失控

网传某车企疑似“养龙虾”致员工电脑集体失控

三言科技
2026-03-11 20:55:39
让霍尔木兹海峡关闭的,不是伊朗,而是这七家再保险机构

让霍尔木兹海峡关闭的,不是伊朗,而是这七家再保险机构

知识圈
2026-03-11 22:16:23
百度的新段子看乐了:李彦宏吐槽豆包不一定比我们好,但它不给我看广告

百度的新段子看乐了:李彦宏吐槽豆包不一定比我们好,但它不给我看广告

爆角追踪
2026-03-11 19:04:48
苹果首款折叠屏机型顶配版定价超2万元!将成为苹果最贵手机

苹果首款折叠屏机型顶配版定价超2万元!将成为苹果最贵手机

大象新闻
2026-03-12 08:41:03
她果然没离,毕竟400亿资产的男人也不多啊!

她果然没离,毕竟400亿资产的男人也不多啊!

BenSir本色说
2026-03-11 22:06:22
安理会未通过俄提交涉伊朗决议

安理会未通过俄提交涉伊朗决议

财联社
2026-03-12 04:54:03
去了香港我才发现:没人穿北面、始祖鸟,满街都是这3个中产品牌

去了香港我才发现:没人穿北面、始祖鸟,满街都是这3个中产品牌

老好人的愤怒
2026-03-12 10:13:50
记者:出于对科比的尊重,阿德巴约应该被换下场,而不是砍下83分

记者:出于对科比的尊重,阿德巴约应该被换下场,而不是砍下83分

懂球帝
2026-03-12 02:33:04
日媒:大阪街道上巨大管状物“拔地而起”,有关部门正在调查原因

日媒:大阪街道上巨大管状物“拔地而起”,有关部门正在调查原因

环球网资讯
2026-03-11 16:47:41
“臭哄大炕有啥可显摆的”,东北嫡长女被嘲没教养,难登大雅之堂

“臭哄大炕有啥可显摆的”,东北嫡长女被嘲没教养,难登大雅之堂

妍妍教育日记
2026-03-11 18:07:53
2026-03-12 12:03:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
14698文章数 66687关注度
往期回顾 全部

科技要闻

腾讯"养虾"暴涨后,百度急得在门口"装虾"

头条要闻

刚从伊朗回来的中国学者:街上是平静的 人心是涌动的

头条要闻

刚从伊朗回来的中国学者:街上是平静的 人心是涌动的

体育要闻

要脸,还是要83分纪录?

娱乐要闻

李湘瘦身惊艳亮相肖邦之夜 携女儿出席

财经要闻

卢锋:从特朗普团队群演看时代变局

汽车要闻

大众2025财报:转型虽有阵痛 "大象"已然起跑

态度原创

房产
本地
旅游
时尚
健康

房产要闻

最低杀到7800元/㎡!海口2026第一波房价大调整来了!

本地新闻

这档韩国玄学综艺,让多少人看得头皮发麻

旅游要闻

伊斯坦布尔亚洲老城区

今年春天最时髦的6组搭配,照着穿美出新高度!

转头就晕的耳石症,能开车上班吗?

无障碍浏览 进入关怀版