网易首页 > 网易号 > 正文 申请入驻

AI用3年时光,来了解你!首个AI Clone长期记忆基准

0
分享至


新智元报道

编辑:LRST

【新智元导读】现有AI记忆评测存在局限,如数据源单一、忽视变化本质、注入成本高等。CloneMem通过层次化生成框架构建合成人生,设计贴近真实场景的评测任务,涵盖多种问题类型。实验发现简单方法在检索上更有效,复杂系统会丢失关键细节,记忆系统应保留细节和时间脉络,还原而非压缩信息,以更好地理解人。

AI数字分身正在从科幻走向现实帮你回邮件、管理日程,甚至可以直接替你和别人coffee chat。

但问题是:AI如何深度了解并与你保持同步

不仅要「知道」你叫什么,住在哪里,喜欢听什么音乐,喜欢吃什么,更要「持续了解」:这几年你经历了什么、你的想法是如何一步步转变的、为什么去年你想要跳槽,但今年却想要留下。

这些,才真正定义了你是谁。

针对这一问题,开源学术社区QuantaAlpha联合国内外知名高校团队提出了CloneMem——首个专门评估AI Clone长期记忆能力的基准测试,并提供了中英文双语版本


论文链接:https://arxiv.org/pdf/2601.07023

代码数据:https://github.com/AvatarMemory/CloneMemBench


AI Clone 应用场景示意图

人生的关键变化

往往不发生在聊天框里

现有AI记忆评测主要考察模型能否记住用户与AI之间说过的话。但这套评测范式存在三个根本局限:

数据源单一。

仅依赖用户与AI的对话记录,而这些记录往往只反映了生活中的某些片段。更关键的是,对话内容高度依赖用户主动表达,本身就已经经过个人的二次叙述,很难还原一个人真实而连续的生活轨迹。

忽视「变化」的本质。

现有基准关注的是「AI 能否记住某个事实」,而非「AI 能否理解这个人是怎么一步步变成现在这样的」——经历如何塑造情绪,情绪如何影响观点,观点又如何左右选择。

注入成本高。

想让AI了解你,你得不断主动和它聊。但谁有时间每天给AI写日记?这种机制难以长期维持。


CloneMem与现有记忆评测基准对比

数据怎么造?

层次化生成一个合成人生

真实用户数据涉及隐私,研究团队设计了一套层次化生成框架:

宏观层面,基于大五人格初始化人物设定,构建职业、家庭、情绪、价值观等长期人生弧线;中观层面,将每个重大事件拆分为多个阶段,维护内部状态快照(能量、压力、情绪、关注焦点),状态在阶段间传递以保证连贯性;微观层面,为每个阶段生成具体事件,并同步产出日记、帖子、消息等多种媒介内容。

这种自顶向下的设计确保了经历、情绪、观点在长时间跨度上保持一致。


CloneMem 完整的数据构建流程

面向真实交互场景的评测任务设计

CloneMem设计了一系列贴近真实使用场景的评测任务。所有问题都从「与AI Clone聊天的朋友」视角出发,而不是系统自问自答。

提问者像现实中的熟人一样,会在不同时间点向AI Clone询问你的近况和想法。

更关键的是,这些问题不是集中在某一个时间段,而是贯穿在你完整的人生时间线上,这也就意味着模型需要在横跨数年的日记、社交媒体、聊天记录和邮件等多源记录里,找到关键信息,并理解经历如何影响情绪,情绪如何塑造观点,观点又如何推动选择,才能做出正确的判断。


CloneMem评测任务示例

CloneMem设计了7种问题类型,涵盖了事实回忆、规律识别、变化对比、长期轨迹理解、因果推理、反事实推理,以及无法回答的情况。

而考虑到在真实场景下的开放式问答难度不低,CloneMem也为每道简答题设计了对应的选择题版本,用来降低难度。

实验发现

简单方法反超,复杂系统压缩掉关键细节

研究团队从检索能力、记忆有效性和回答一致性等多个维度,对Flat Retriever、A-MEM和Mem0三种记忆系统进行了评估,结果却有些出人意料。

在检索层面,简单方法反而更有效

在多数指标上,最简单的Flat Retriever表现最好。原因是抽象和总结虽然有助于搜索,但会损失细节保真度。而AI Clone任务高度依赖时间顺序、原始表述、事件间的细微关联,而这些信息往往在摘要的过程中被压缩掉了。


不同记忆系统的 QA 性能与记忆效用对比(Oracle 为使用真实上下文的上界)

在表征层面,记忆系统只记事件,而不记状态

以老沈为例,他正在经历中年危机,连续两周在凌晨浏览招聘网站,搜索各种岗位信息。记忆系统非常诚实的记下了这些行为,但无法表征他还在犹豫,一份简历都没投出去的状态。

因此当被问到老沈有没有看重的公司时,模型面对一堆求职相关的行为记录,自然会脑补出老沈看重了几家公司,然而实际上,他什么都没有决定。

在生成层面,模型容易被叙事惯性所带偏

即使检索到了正确的信息,模型仍然倾向于套用高概率叙事模板,而并没有依据事实证据。比如当问老沈为什么愿意向妻子敞开心扉,正确答案是他意识到长期强撑正在伤害家庭,模型却回答女儿的一幅画触动了他,这听起来很合理,但证据完全对不上。

对记忆系统设计的启示

CloneMem的实验结果指向一个核心问题:当前的记忆系统把记住当成了目标,但AI Clone真正需要的是还原。

这意味着记忆系统不能只做信息压缩,而要保留原始表述和时间脉络;不能只记发生了什么事,还要能表征一个人正在经历什么阶段;不能总是给出答案,而要在证据不足时学会说不知道。

换句话说,AI Clone的记忆不应该是一个越压越小的知识库,而应该是一个保留完整证据链的底座,因为理解一个人,靠的不是摘要,而是细节。

QuantaAlpha

QuantaAlpha成立于2025年4月,由来自国内外知名院校的老师和学生组成,使命是探索智能的「量子」,引领智能体研究的「阿尔法」前沿,从CodeAgent到自进化智能,再到金融与跨领域专用智能体,致力于重塑人工智能的边界。

2026年,研究团队将在CodeAgent、DeepResearch、Agent Memory、Agentic Reasoning/Agentic RL、自进化与协同学习等方向持续产出高质量研究成果,欢迎对我们方向感兴趣的同学加入我们!


团队主页:https://quantaalpha.github.io/

参考资料:

https://arxiv.org/pdf/2601.07023


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中超神剧情:第81分钟进球,补时点射绝平,王钰栋哑火:8场仅1球

中超神剧情:第81分钟进球,补时点射绝平,王钰栋哑火:8场仅1球

足球狗说
2026-05-10 21:38:44
李家鼎向李泳豪呻窮憂200萬老本不保,開雙簽戶口遭大仔夫婦截擊

李家鼎向李泳豪呻窮憂200萬老本不保,開雙簽戶口遭大仔夫婦截擊

粤睇先生
2026-05-10 20:50:50
张雪差点被“下套”!一凯越车主连麦,希望听诊发动机故障被拒绝

张雪差点被“下套”!一凯越车主连麦,希望听诊发动机故障被拒绝

火山詩话
2026-05-10 08:41:30
李源一踢不动了,韩鹏换人保守,泰山队2将停赛 谢文能改位置成功

李源一踢不动了,韩鹏换人保守,泰山队2将停赛 谢文能改位置成功

替补席看球
2026-05-10 20:04:03
拿着月薪2万奔赴曼谷定居,本以为能潇洒当富人,却被现实狠狠上了一课

拿着月薪2万奔赴曼谷定居,本以为能潇洒当富人,却被现实狠狠上了一课

芳姐侃社会
2026-05-09 18:20:11
16GB+512GB+6400mAh,一加热销手机重回低价,高配版跌至2339元

16GB+512GB+6400mAh,一加热销手机重回低价,高配版跌至2339元

小愚测评
2026-05-10 23:55:54
最爽的人,都在县城400块的希尔顿里躺着

最爽的人,都在县城400块的希尔顿里躺着

一刻talks丨硬科技趣思想
2026-05-07 20:35:15
中国3大长寿食物,鸡蛋排第3,第1很多人想不到,中老年要常吃

中国3大长寿食物,鸡蛋排第3,第1很多人想不到,中老年要常吃

小胡军事爱好
2026-05-10 22:12:06
一半中国人蛋白质没吃够!医生:50岁以上人群,每天这样吃才达标

一半中国人蛋白质没吃够!医生:50岁以上人群,每天这样吃才达标

路医生健康科普
2026-05-03 11:40:03
穆斯卡特:整体防守做得还可以,颜骏凌又一次帮助球队拿分

穆斯卡特:整体防守做得还可以,颜骏凌又一次帮助球队拿分

懂球帝
2026-05-10 23:26:08
中超11轮积分榜:10支球队积分上双,4队同积10分,津门虎转正

中超11轮积分榜:10支球队积分上双,4队同积10分,津门虎转正

中超伪球迷
2026-05-10 22:14:13
甲钴胺立大功!医生研究发现:老人吃甲钴胺,或能缓解4种症状

甲钴胺立大功!医生研究发现:老人吃甲钴胺,或能缓解4种症状

39健康网
2026-05-10 19:33:58
Shams:勇士将在休赛期寻找一名明星球员来与库里搭档

Shams:勇士将在休赛期寻找一名明星球员来与库里搭档

懂球帝
2026-05-10 23:08:33
明天A股就开盘了!就问你怕不怕!

明天A股就开盘了!就问你怕不怕!

龙行天下虎
2026-05-10 19:17:16
杨鸣和赵继伟一起去北控?听上去很美好,但是辽篮真会这么做吗?

杨鸣和赵继伟一起去北控?听上去很美好,但是辽篮真会这么做吗?

君马体育
2026-05-11 00:00:02
米体:何塞普最近表现出色,国米打算不再去引进维卡里奥

米体:何塞普最近表现出色,国米打算不再去引进维卡里奥

懂球帝
2026-05-10 23:26:10
中方绝不容忍!中国大使向英国提出严正交涉

中方绝不容忍!中国大使向英国提出严正交涉

第一财经资讯
2026-05-10 17:08:08
难怪特朗普这么急着访华,原来想让中国帮美国缓解“燃眉之急”。

难怪特朗普这么急着访华,原来想让中国帮美国缓解“燃眉之急”。

阿七说史
2026-05-10 05:05:06
哈维-巴恩斯:我们领先后处理得一直不好,很难说清原因

哈维-巴恩斯:我们领先后处理得一直不好,很难说清原因

懂球帝
2026-05-10 23:50:09
野心真大!张本智和扬言:不止击败中国队,还要开创日本时代

野心真大!张本智和扬言:不止击败中国队,还要开创日本时代

十点街球体育
2026-05-10 12:20:50
2026-05-11 00:27:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
15178文章数 66858关注度
往期回顾 全部

科技要闻

DeepSeek融资,改写所有人的估值

头条要闻

儿子车祸受伤生存希望不足0.1% 母亲请中医熬"还魂汤"

头条要闻

儿子车祸受伤生存希望不足0.1% 母亲请中医熬"还魂汤"

体育要闻

那个曾让詹姆斯抱头的兄弟,40岁从大学毕业了

娱乐要闻

赵露思老实人豁出去了 没舞蹈天赋硬跳

财经要闻

白酒大逃杀

汽车要闻

轴距加长/智驾拉满 阿维塔07L定位大五座SUV

态度原创

家居
数码
亲子
房产
游戏

家居要闻

菁英人居 全能豪宅

数码要闻

古尔曼:苹果macOS 27将进一步完善液态玻璃设计

亲子要闻

“顺”还是“剖”?从成为母亲的选择说起

房产要闻

低价甩卖!海口这个地标商业,无人接盘!

《明末》官号复活!连发多条动态 网友感叹担忧

无障碍浏览 进入关怀版