网易首页 > 网易号 > 正文 申请入驻

AI用3年时光,来了解你!首个AI Clone长期记忆基准

0
分享至


新智元报道

编辑:LRST

【新智元导读】现有AI记忆评测存在局限,如数据源单一、忽视变化本质、注入成本高等。CloneMem通过层次化生成框架构建合成人生,设计贴近真实场景的评测任务,涵盖多种问题类型。实验发现简单方法在检索上更有效,复杂系统会丢失关键细节,记忆系统应保留细节和时间脉络,还原而非压缩信息,以更好地理解人。

AI数字分身正在从科幻走向现实帮你回邮件、管理日程,甚至可以直接替你和别人coffee chat。

但问题是:AI如何深度了解并与你保持同步

不仅要「知道」你叫什么,住在哪里,喜欢听什么音乐,喜欢吃什么,更要「持续了解」:这几年你经历了什么、你的想法是如何一步步转变的、为什么去年你想要跳槽,但今年却想要留下。

这些,才真正定义了你是谁。

针对这一问题,开源学术社区QuantaAlpha联合国内外知名高校团队提出了CloneMem——首个专门评估AI Clone长期记忆能力的基准测试,并提供了中英文双语版本


论文链接:https://arxiv.org/pdf/2601.07023

代码数据:https://github.com/AvatarMemory/CloneMemBench


AI Clone 应用场景示意图

人生的关键变化

往往不发生在聊天框里

现有AI记忆评测主要考察模型能否记住用户与AI之间说过的话。但这套评测范式存在三个根本局限:

数据源单一。

仅依赖用户与AI的对话记录,而这些记录往往只反映了生活中的某些片段。更关键的是,对话内容高度依赖用户主动表达,本身就已经经过个人的二次叙述,很难还原一个人真实而连续的生活轨迹。

忽视「变化」的本质。

现有基准关注的是「AI 能否记住某个事实」,而非「AI 能否理解这个人是怎么一步步变成现在这样的」——经历如何塑造情绪,情绪如何影响观点,观点又如何左右选择。

注入成本高。

想让AI了解你,你得不断主动和它聊。但谁有时间每天给AI写日记?这种机制难以长期维持。


CloneMem与现有记忆评测基准对比

数据怎么造?

层次化生成一个合成人生

真实用户数据涉及隐私,研究团队设计了一套层次化生成框架:

宏观层面,基于大五人格初始化人物设定,构建职业、家庭、情绪、价值观等长期人生弧线;中观层面,将每个重大事件拆分为多个阶段,维护内部状态快照(能量、压力、情绪、关注焦点),状态在阶段间传递以保证连贯性;微观层面,为每个阶段生成具体事件,并同步产出日记、帖子、消息等多种媒介内容。

这种自顶向下的设计确保了经历、情绪、观点在长时间跨度上保持一致。


CloneMem 完整的数据构建流程

面向真实交互场景的评测任务设计

CloneMem设计了一系列贴近真实使用场景的评测任务。所有问题都从「与AI Clone聊天的朋友」视角出发,而不是系统自问自答。

提问者像现实中的熟人一样,会在不同时间点向AI Clone询问你的近况和想法。

更关键的是,这些问题不是集中在某一个时间段,而是贯穿在你完整的人生时间线上,这也就意味着模型需要在横跨数年的日记、社交媒体、聊天记录和邮件等多源记录里,找到关键信息,并理解经历如何影响情绪,情绪如何塑造观点,观点又如何推动选择,才能做出正确的判断。


CloneMem评测任务示例

CloneMem设计了7种问题类型,涵盖了事实回忆、规律识别、变化对比、长期轨迹理解、因果推理、反事实推理,以及无法回答的情况。

而考虑到在真实场景下的开放式问答难度不低,CloneMem也为每道简答题设计了对应的选择题版本,用来降低难度。

实验发现

简单方法反超,复杂系统压缩掉关键细节

研究团队从检索能力、记忆有效性和回答一致性等多个维度,对Flat Retriever、A-MEM和Mem0三种记忆系统进行了评估,结果却有些出人意料。

在检索层面,简单方法反而更有效

在多数指标上,最简单的Flat Retriever表现最好。原因是抽象和总结虽然有助于搜索,但会损失细节保真度。而AI Clone任务高度依赖时间顺序、原始表述、事件间的细微关联,而这些信息往往在摘要的过程中被压缩掉了。


不同记忆系统的 QA 性能与记忆效用对比(Oracle 为使用真实上下文的上界)

在表征层面,记忆系统只记事件,而不记状态

以老沈为例,他正在经历中年危机,连续两周在凌晨浏览招聘网站,搜索各种岗位信息。记忆系统非常诚实的记下了这些行为,但无法表征他还在犹豫,一份简历都没投出去的状态。

因此当被问到老沈有没有看重的公司时,模型面对一堆求职相关的行为记录,自然会脑补出老沈看重了几家公司,然而实际上,他什么都没有决定。

在生成层面,模型容易被叙事惯性所带偏

即使检索到了正确的信息,模型仍然倾向于套用高概率叙事模板,而并没有依据事实证据。比如当问老沈为什么愿意向妻子敞开心扉,正确答案是他意识到长期强撑正在伤害家庭,模型却回答女儿的一幅画触动了他,这听起来很合理,但证据完全对不上。

对记忆系统设计的启示

CloneMem的实验结果指向一个核心问题:当前的记忆系统把记住当成了目标,但AI Clone真正需要的是还原。

这意味着记忆系统不能只做信息压缩,而要保留原始表述和时间脉络;不能只记发生了什么事,还要能表征一个人正在经历什么阶段;不能总是给出答案,而要在证据不足时学会说不知道。

换句话说,AI Clone的记忆不应该是一个越压越小的知识库,而应该是一个保留完整证据链的底座,因为理解一个人,靠的不是摘要,而是细节。

QuantaAlpha

QuantaAlpha成立于2025年4月,由来自国内外知名院校的老师和学生组成,使命是探索智能的「量子」,引领智能体研究的「阿尔法」前沿,从CodeAgent到自进化智能,再到金融与跨领域专用智能体,致力于重塑人工智能的边界。

2026年,研究团队将在CodeAgent、DeepResearch、Agent Memory、Agentic Reasoning/Agentic RL、自进化与协同学习等方向持续产出高质量研究成果,欢迎对我们方向感兴趣的同学加入我们!


团队主页:https://quantaalpha.github.io/

参考资料:

https://arxiv.org/pdf/2601.07023


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
3月17日重庆新桥医院 广西女子求医挂不上号 医生下班蹲地看片暖哭

3月17日重庆新桥医院 广西女子求医挂不上号 医生下班蹲地看片暖哭

观星赏月
2026-03-26 05:17:03
服务犬第一次坐飞机,不忘叼着自己的阿布布,全程乖巧像小玩偶

服务犬第一次坐飞机,不忘叼着自己的阿布布,全程乖巧像小玩偶

Magic宠物社
2026-03-25 19:11:59
极氪,不慌了

极氪,不慌了

autocarmax
2026-03-25 20:47:24
初代丑男何润东的突然爆火,狠狠抽了内娱一巴掌

初代丑男何润东的突然爆火,狠狠抽了内娱一巴掌

娱乐圈笔娱君
2026-03-24 16:08:36
炸毁美雷达和直升机后,伊拉克官方下令:民兵可放开打美伊

炸毁美雷达和直升机后,伊拉克官方下令:民兵可放开打美伊

阿龙聊军事
2026-03-25 17:43:37
高考录取线TOP100高校,排名发布!

高考录取线TOP100高校,排名发布!

麦可思研究
2026-03-25 09:51:31
“霍尔木兹决战”,不打了

“霍尔木兹决战”,不打了

中国新闻周刊
2026-03-25 18:43:08
《浪姐7》糊咖扎堆,大牌只有两位,3人成流量担当,4人有黑马相

《浪姐7》糊咖扎堆,大牌只有两位,3人成流量担当,4人有黑马相

八卦南风
2026-03-25 17:32:20
张雪峰去世,“跑完步就不行了”:苏州独墅湖医院外的生死4小时

张雪峰去世,“跑完步就不行了”:苏州独墅湖医院外的生死4小时

哲学船
2026-03-25 00:44:19
36岁中国大哥在非洲开“手机网吧”,生意火爆到需要排队取号,当事人:投入很小,仅花了点流量钱,最火的时候10来个人看一个手机

36岁中国大哥在非洲开“手机网吧”,生意火爆到需要排队取号,当事人:投入很小,仅花了点流量钱,最火的时候10来个人看一个手机

观威海
2026-03-26 09:19:03
通用丰田等联名致函:敦促美国继续限制进口中国车

通用丰田等联名致函:敦促美国继续限制进口中国车

快科技
2026-03-24 11:18:08
欧尔班的好日子到头了

欧尔班的好日子到头了

民间胡扯老哥
2026-03-25 05:22:48
马布里,48岁,刚领着一位中国姑娘去领了证。

马布里,48岁,刚领着一位中国姑娘去领了证。

南权先生
2026-02-28 15:50:16
曝张雪峰去年3月已立遗嘱,遗产由女儿单独继承,他真的很爱女儿

曝张雪峰去年3月已立遗嘱,遗产由女儿单独继承,他真的很爱女儿

观鱼听雨
2026-03-26 10:43:02
特朗普希望破灭了,但是福特号航母上4500名美军士兵却彻底安全了

特朗普希望破灭了,但是福特号航母上4500名美军士兵却彻底安全了

安安说
2026-03-26 11:41:14
高铁直达!比起昆明和大理,我更爱这个被严重低估的云南小城!

高铁直达!比起昆明和大理,我更爱这个被严重低估的云南小城!

匿旅
2026-03-25 23:05:23
不可思议,德国人急了,日本急了,美国也急了,中国这下赢麻了。

不可思议,德国人急了,日本急了,美国也急了,中国这下赢麻了。

阿七说史
2026-03-09 16:01:03
2.4亿成全你!詹姆斯降薪2000万?双詹合体咋办!

2.4亿成全你!詹姆斯降薪2000万?双詹合体咋办!

柚子说球
2026-03-25 11:44:10
内塔尼亚胡:对恶绝不手软,才是对和平最大的负责

内塔尼亚胡:对恶绝不手软,才是对和平最大的负责

老马拉车莫少装
2026-03-22 23:24:28
不吹不黑!iOS 26.4正式版体验,老iPhone直接封神

不吹不黑!iOS 26.4正式版体验,老iPhone直接封神

叮当当科技
2026-03-26 01:51:54
2026-03-26 14:04:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
14819文章数 66720关注度
往期回顾 全部

科技要闻

Meta高管狂分百亿期权,700名员工却下岗

头条要闻

伊朗议长和外长暂被移出美以清除名单 时限4到5天

头条要闻

伊朗议长和外长暂被移出美以清除名单 时限4到5天

体育要闻

35岁替补门将,凭什么入选英格兰队?

娱乐要闻

张雪峰家人首发声 不设追思会丧事从简

财经要闻

黄仁勋:芯片公司的时代已经结束了

汽车要闻

一汽奥迪A6L e-tron开启预售 CLTC最大续航815km

态度原创

数码
手机
本地
公开课
军事航空

数码要闻

Intel史上最先进!酷睿Ultra 300系列vPro平台发布

手机要闻

三星One UI 9前瞻:小部件更方正、Now Bar动画更丝滑

本地新闻

春日吃花第三站——广东

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

担心特朗普突然停战 以总理下令48小时尽力摧毁伊设施

无障碍浏览 进入关怀版