网易首页 > 网易号 > 正文 申请入驻

AI不再用完即忘:华为诺亚开源MindMemOS,记忆和Skill一起进化

0
分享至

允中 发自 凹非寺量子位 | 公众号 QbitAI

Agent的能力越来越强,但使用体验仍有一个尴尬之处:

每换一个Agent甚至换一个session,就像换了一个完全不了解你的新员工。

用户偏好、项目背景和踩坑经验无法迁移,只能从头解释,再把新Agent“重新养一遍”。

真正的挑战不只在于“有没有记忆”,还在于四件事:

  • 记忆带不走:记忆依附于单个Agent,无法跨应用和框架复用。
  • 记忆视角不同:不同业务关注的实体、属性和提取规则完全不同,一套固定模板难以通用。
  • 记忆系统不会成长:提取、检索和组织策略在开发完成后便基本固化,无法从真实使用与用户纠偏中持续演进。
  • 记忆缺少时间维度:系统既要知道最新事实,也要保留事实如何变化、旧状态如何被新状态取代的过程。

为此,华为诺亚方舟实验室推出了面向AI Agent的可迁移、自演进记忆操作层MindMemOS



它将记忆从单个Agent中解耦;

记忆建模以实体、属性、时间三维结构同时保存最新状态与完整演化轨迹;

通过MindSchema记忆模式预设记忆提取规则,或围绕给定任务与标注问答离线演化提取策略;

Feedback挖掘用户隐式的纠正性反馈,有选择地强化或降级已有记忆,从而提升记忆的可靠性及其与用户意图的一致性。

Dreaming离线巩固记忆,消解冲突,持续提升记忆质量。

MindMemOS想解决的不只是“怎样让Agent记住”,而是记忆怎样带得走,系统怎样知道该记什么,以及记忆与记忆系统怎样一起进化。

更直接的是结果:

  • MindMemOS在LoCoMo上取得分,在PersonaMem上达到70.63%
  • 在MemoryAgentBench的FactConsolidation测试中,Dreaming压缩19.4%-23.5%活跃记忆的同时,将问答准确率最高提升10.3个百分点
  • 基于真实执行轨迹的Skill演进,则把SpreadsheetBench-Verified的任务成功率提升至57.2%±2.4%

项目地址:https://github.com/mindscale-noah/MindMemOS
项目官网:https://mindmemos.cn



MindMemOS将Agent接入、记忆算法与底层记忆结构解耦,并把质量优化和Skill Evolution纳入同一系统。

用「实体-属性-时间」重建记忆中的世界

MindMemOS首先改变了记忆的基本组织方式。

传统方案常把记忆保存为一组文本片段或向量块。MindMemOS则用一个三维结构描述开放世界的信息流:

  • 实体(Entity):人、项目、文件、工具、组织等持续存在的对象;
  • 属性(Property):对象的事实、偏好、状态和高阶特征;
  • 时间(Time):属性在什么时间成立,又在何时发生变化。



每条记忆都可以落到“实体、属性、时间”的唯一坐标,同时保留实体关系和属性演变轨迹。

这相当于不再把“用户以前喜欢X”和“用户现在改用Y”当成两段互不相干的文本,而是把它们放回同一实体、同一属性的时间轴上。

实体之间可以建立语义关联,每个属性的演变也能被追踪。

在此之上,MindMemOS提供两条互补的记忆生成路径。

一条是MindVanilla模式

它不依赖预先定义的建模模板,可以接收对话、文本和工具执行轨迹,适合开放域信息快速进入统一记忆库。

另一条是MindSchema模式

系统先通过实体建模规定当前领域关注哪些实体和属性,再完成话题片段切分、属性级记忆生成、等价实体融合和图结构合并。

不同场景可以调整记忆提取规则种子,让同一套系统适配不同任务,而不必重写整个记忆基础设施。

检索时,MindMemOS也不是只做一次向量相似度匹配。

它设计了一套Compact Search:

  • 外层Agentic模块负责分析查询、规划检索路径和判断信息是否充分;
  • 内层工具则执行从实体到属性、从属性反查实体、多跳关系扩展和属性时间线追踪等多路径搜索。

简单来说,系统不只是寻找“最像问题的一段话”,而是在记忆图中寻找抵达答案最短、同时覆盖信息最充分的路径。

Dreaming:让Agent在「空闲时间」整理记忆

人类不会永久保留每个细节。我们会在回顾中合并重复信息、淘汰过时判断,并从多次经历中形成更抽象的认识。

业界把类似过程称为Dreaming

Dreaming在离线阶段从尚未整理的记忆出发,围绕相关实体扩展局部范围,识别重复、冲突和演化关系,再生成具体操作:合并冗余内容、归档被新事实取代的旧记忆、补充关系,或发现更高阶的模式。

关键在于,这种整理结果会变成持久的记忆状态,而不是把判断压力留给每一次回答时的语言模型。

例如,当同一个实体对应两条相互冲突的事实时,普通检索可能把两条内容一起返回,再期待回答模型临场判断。

MindMemOS会在Dreaming阶段识别其中的替代关系,归档已经失效的版本,并保留supersedes关系。之后的普通检索拿到的是更干净、没有歧义的上下文。

这里有一个更直观的Case Study。

MemoryAgentBench先后写入两条互相冲突的事实,并规定后写入的事实应当覆盖旧版本。

Dreaming之前,两条记忆都会进入检索上下文,回答模型受到现实世界知识干扰而选择了旧答案;

Dreaming之后,系统把较早版本归档、建立supersedes关系,同一查询便只会得到当前有效的事实。



Dreaming将冲突判断从每次查询时的临场推理,前移为可持续保存的离线记忆状态。

MindMemOS在MemoryAgentBench的FactConsolidation子集上,测试了这一机制:



结果显示,Dreaming并不是通过“记得更多”换取提升。

相反,它在提高Single-hop和Multi-hop得分的同时,将大约五分之一的活跃记忆转入归档(归档则不会被主动召回)。

这是一种典型的“少即是多”:减少干扰,本身就是提升记忆质量的一部分。

Feedback:用户的一次纠正,不应该只修一条答案

Dreaming负责系统主动整理,Feedback则让用户交互中的纠错信号回到记忆系统。

MindMemOS同时支持显式与隐式反馈。

用户可以直接用自然语言指出某条记忆错误,也可以在后续对话中表达不满、修正或新的偏好。

系统会判断这条信号是当前任务临时信息、特定场景偏好,还是适合长期保留的规律,再决定新增、更新、归档、删除或强化相关记忆。

这一步很重要,因为用户偏好往往不只是一个“是什么”的事实。

一个用户说自己偏好临时约见,真正影响推荐的可能是背后的原因:低压力安排反而能让其更可靠地赴约。

随着更多交互出现,系统需要逐渐补全“为什么”和“在什么场景下成立”,而不是无限新增相似的碎片。

论文中的PersonaMem-Evo案例展示了这种变化。

Feedback之前,系统只留下“偏好临时安排”这条表层信息,在Top-10中仅召回一条模糊相关记忆,最终给出了结构化群体活动这一错误选项。

Feedback从多轮交互中识别出真正稳定的关系是“喜欢临时或当天计划,担心长期计划有变”,并为其补上社交场景边界。

更新后,三条一致的社交规划记忆共同进入Top-10,答案也转向正确的“自发一对一活动”。



Feedback不只是增加一条记忆,而是更新原记忆的语义结构、归档旧版本,并改变后续检索结果。

因此,Feedback的目标不只是修改单条记忆。

期望是让反馈继续作用于记忆提取、检索和组织策略,实现记忆内容与记忆系统的共同演进。

不只记住发生过什么,还要沉淀「下一次怎么做」,持续优化Skills

如果说事实和偏好让Agent更懂用户,那么Skill决定了它能否把经验真正变成能力。

MindMemOS将Skill视为记忆系统的一个关键应用。

系统提供云端Skill注册、版本链、同步和回滚能力,并通过统一的Memory Add接口收集真实任务轨迹。

不同Agent框架只需在轨迹中附带本次使用的Skill上下文,系统便能把执行结果绑定到对应版本。

当轨迹积累到一定数量后,MindMemOS会依次完成:

真实任务轨迹

→ 提取目标、关键转折、工具使用和最终结果

→ 聚合反复成功的策略与反复出现的失败

→ 生成针对当前SKILL.md的修改计划

→ 应用编辑并生成新的Skill版本

→ 同步回后续任务

如果轨迹没有任务得分,系统可以从反复出现的成功路径和失败模式中做无监督演进(MindEvolve-Unsup);

如果有评分,则会强化高分轨迹中的有效行为,并抑制低分轨迹里的常见错误(MindEvolve-Sup)。

论文在包含400个真实表格操作任务的SpreadsheetBench-Verified上。进行了三次重复实验:



SpreadsheetBench-Verified任务成功率。结果为三次重复实验的均值与标准差;亮蓝和深蓝分别代表MindEvolve的无监督与监督演进配置。

这里有一个颇有意思的结果:未经优化的初始Skill甚至低于No-skill

换句话说,给Agent一份操作指南并不必然带来提升,过时、冗余或不适配任务分布的规则反而可能制造干扰。

而MindMemOS的无监督演进仅依靠执行轨迹,就将成功率从51.3%提升到55.3%;加入任务评分后进一步达到57.2%,相比No-skill提升5.9个百分点,相比未经演进的Init-skill提升9.2个百分点。

这进一步解释了这些数字从何而来:

最初的表格Skill主要是一份openpyxl、pandas使用说明,只告诉Agent怎样打开、编辑和保存工作簿,却没有覆盖真实任务中反复出现的失败:公式不会被openpyxl自动重算、格式化空行会让ws.max_row虚高、在活动工作表上一边读取一边写入可能移动行或覆盖源数据,保存成功也不代表结果已经通过验证。

无监督演进从失败轨迹中把这些经验改写成可执行约束,例如:不要把公式文本当作数值;筛选、排序和删除时先从源表构造稳定快照;保存后必须重新打开文件并按评测读取方式复核。

它完成的不是“增加更多API教程”,而是把反复踩坑的历史压缩成通用避错规则。

加入任务分数后,监督式演进又学会了规则的适用边界。

例如,它不会为了通过缓存值检查而把所有公式粗暴替换成硬编码数值;写入复杂工作簿前,还要先确认源列、目标列和映射关系。

也就是说,监督信号带来的不只是更多规则,而是让Skill逐渐知道一条规则何时应该使用、何时应该停止。

Skill不再是一份写完就不动的提示词文件,而可以成为一项带版本、带证据、可持续更新的长期能力资产。

记忆基准SOTA

除了Dreaming与Skill演进,MindMemOS还在两项主流长期记忆基准上评估了基础记忆能力。

LoCoMo包含10组超长多会话对话。使用gpt-4.1-mini作为回答模型,并将系统、检索、回答和评判配置与EverOS默认实现对齐。

MindMemOS-Modeling的Overall Accuracy达到,成为所有对比方法中的最高结果。



LoCoMo Overall Accuracy。灰色为对比方法,蓝色为MindMemOS两种配置。

在面向长期个性化的PersonaMem上,MindMemOS-MindSchema的Overall Accuracy为70.63%;MindMemOS-MindVanilla也以67.74%略高于Baseline。



PersonaMem Overall Accuracy。灰色为对比方法,蓝色为MindMemOS两种配置

这些结果共同指向一个结论:结构化建模的价值,不只是让记忆“看起来更整齐”,而是让系统在长期事实召回、用户画像和个性化推断中获得可测量的提升

从API、SDK到插件:记忆应该独立于某个Agent

MindMemOS在架构上将Agent接入层、记忆算法层与记忆结构层解耦。

当前开源代码提供FastAPI HTTP接口、Python SDK、CLI、Skills以及OpenClaw插件等接入方式,覆盖add、search、update、delete、feedback和dreaming等完整记忆生命周期操作。

这种解耦带来的直接价值是可迁移性:记忆不必继续绑定在某个Agent的私有实现中,而可以作为用户、项目或组织独立维护的长期资产,在不同应用和Agent框架之间复用。

开发者既可以本地部署完整服务,也可以从云端API、SDK或CLI开始接入。

项目采用MIT License,详细部署配置与评测流程均已随代码公开。

  • Tips:MindMemOS云服务现已开放注册试用;
  • 在GitHub为项目点亮Star后,还可获得更多使用额度。

项目官网:https://mindmemos.cn

当自动算法设计开始积累经验:MindMemOS在LLM4AD NEXT中的应用

基于大模型的自动算法设计正在展现潜力,但这类任务通常需要经历大量候选生成、评测与迭代。

若缺少长期记忆,模型很容易反复尝试已经被证明无效的方案;切换任务后,上一轮探索积累的设计经验也可能随上下文一起消失。

为此,MindMemOS已接入自动算法设计平台LLM4AD_Next,将算法搜索过程中产生的反馈转化为可存储、可检索、可复用的经验资产。

针对算法设计任务层次多、周期长的特点,平台构建了三层记忆:

  • 任务记忆(Task Memory):动态捕捉并提炼当前算法设计任务中的即时灵感与失败教训。
  • 项目记忆(Project Memory):深度沉淀特定应用场景(如组合优化任务等)下的专家共识与先验知识。
  • 全局记忆(Global Memory):固化跨项目、普适性的底层算法设计规范与基本范式。

基于该架构,平台能够将从高分结果中提炼的“有效经验”与从低分试错中总结的“避坑指南”进行系统化存储。

为了精准适配复杂多变的科研场景,系统支持两种灵活的记忆调度机制:

LLM4AD_Next提供两种记忆调度方式:Auto Mode根据当前任务和上下文自动匹配历史经验,Manual Mode则允许研究人员精确选择需要注入的记忆。

记忆的调用、注入与流转过程全程可视化,使研究人员能够观察某条经验如何影响算法生成,也更方便开展消融实验与对照分析。

MindMemOS的核心愿景,是确保大模型的每一份反馈都能转化为高价值、可复用的数字资产。

在MindMemOS的赋能下,LLM4AD_Next所执行的每一次算法搜索,都不再是孤立的尝试,而是通往下一次“进化”的坚实起点。

由MindMemOS赋能的全新自动算法发现平台LLM4AD_Next已开放体验,欢迎广大研究者前往探索:

GitHub开源项目:https://github.com/Optima-CityU/LLM4AD_Next
在线体验地址:https://llm4ad-next.cn/

Coming Features

  • 技术报告:MindMemOS完整技术报告即将发布,将进一步披露算法设计、系统实现、评测设置与更多案例分析。
  • Skills系统:与经验记忆联动,自动合成Skills;基于真实执行轨迹持续演化,并针对新问题智能分发和推荐合适的Skills。
  • 文件系统记忆:把散落在本地文件、文档、项目产物和Agent输出中的知识结构化为可检索、可关联的知识对象或知识图谱,让Agent更可靠地使用用户的文件知识。

结语:Agent的下一场竞争,可能是「谁更会积累」

今天的Agent已经拥有越来越强的模型和越来越丰富的工具,但长期智能并不只取决于一次任务能做多好。

真正拉开差距的,可能是完成一百次任务之后,它留下了什么。

是越来越长、越来越混乱的历史记录,还是一套能追踪变化、主动整理、接受纠正,并把成功与失败继续沉淀为Skill的记忆系统?

MindMemOS的答案,是把记忆从Agent的附属缓存提升为独立的操作层:信息可以跨场景建模,冲突可以在离线阶段被消解,反馈可以反向修改记忆,任务轨迹还能继续推动Skill演进。

从“记住用户”到“学会做事”,这或许也是Agent从一次性工具走向长期协作者必须补上的一层基础设施。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
人均600万到欠400亿,毁掉“天下第一村”的并非别人,是他们自己

人均600万到欠400亿,毁掉“天下第一村”的并非别人,是他们自己

混沌录
2026-07-31 23:22:05
去年白吃白喝赚60万,今年刚到大同就被全网盯上:印度“要饭哥”挥断胳膊也没人搭理

去年白吃白喝赚60万,今年刚到大同就被全网盯上:印度“要饭哥”挥断胳膊也没人搭理

背包旅行
2026-08-02 17:27:27
小米造神的传说,彻底失灵了

小米造神的传说,彻底失灵了

新车评网
2026-08-02 20:33:03
印尼陷入困境,坦言无力运营雅万高铁,45 亿对华债务求放宽期限

印尼陷入困境,坦言无力运营雅万高铁,45 亿对华债务求放宽期限

福建睿平
2026-08-03 07:22:33
钱学森儿子钱永刚坦言:父亲当年要是留在美国,我的人生发展或更顺利,不至于拖到34岁才大学毕业

钱学森儿子钱永刚坦言:父亲当年要是留在美国,我的人生发展或更顺利,不至于拖到34岁才大学毕业

磊子讲史
2026-08-03 11:15:30
在斯大林时代,如果你第一个停止鼓掌,或者鼓掌不热烈会怎么样?

在斯大林时代,如果你第一个停止鼓掌,或者鼓掌不热烈会怎么样?

流年顛簸
2026-08-02 06:03:45
彻底反转!婚外胚胎案丈夫反击,漂亮三姐正脸曝光,真相太离谱

彻底反转!婚外胚胎案丈夫反击,漂亮三姐正脸曝光,真相太离谱

众生的世界观
2026-08-03 09:46:54
2026年8月3日周一,人社部和财政部关于调整养老金的通知正式公布了吗?

2026年8月3日周一,人社部和财政部关于调整养老金的通知正式公布了吗?

小谈食刻美食
2026-08-03 07:32:33
博主炮轰小米澎程:“汽车界红米”,“标准低端货”

博主炮轰小米澎程:“汽车界红米”,“标准低端货”

金融界
2026-08-02 15:47:12
1972年有人要撤汪东兴的中办厅主任,毛主席:替我转告总理三句话

1972年有人要撤汪东兴的中办厅主任,毛主席:替我转告总理三句话

兴趣知识
2026-08-02 21:42:40
真不简单啊!近400斤网红良子和助理娟儿订婚,网友:很多明星或网红,最后都娶了贴身助理

真不简单啊!近400斤网红良子和助理娟儿订婚,网友:很多明星或网红,最后都娶了贴身助理

火山詩话
2026-08-03 07:57:55
美国制裁洽洽瓜子、思念水饺、七匹狼男装等,对相关产品进入美国市场实施进口限制

美国制裁洽洽瓜子、思念水饺、七匹狼男装等,对相关产品进入美国市场实施进口限制

扬子晚报
2026-08-03 12:15:37
“这点收入,你还敢生二胎?”四川家长投诉二胎接送问题,被骂惨了

“这点收入,你还敢生二胎?”四川家长投诉二胎接送问题,被骂惨了

妍妍教育日记
2026-07-31 14:36:05
难以置信!谢贤走了不到半个月,女儿谢婷婷在加拿大晒出聚会照:她笑得挺灿烂,看起来心情恢复得不错

难以置信!谢贤走了不到半个月,女儿谢婷婷在加拿大晒出聚会照:她笑得挺灿烂,看起来心情恢复得不错

火山詩话
2026-08-03 06:31:40
传统玩具“竹知了”相关短视频被华为大规模投诉下架!网友懵了:没提余承东名字 没骂华为也侵权?

传统玩具“竹知了”相关短视频被华为大规模投诉下架!网友懵了:没提余承东名字 没骂华为也侵权?

闪电新闻
2026-08-03 08:38:39
中方24小时内对等反制,欧盟官员称“中方能重拳出击,欧盟羡慕”

中方24小时内对等反制,欧盟官员称“中方能重拳出击,欧盟羡慕”

流史岁月
2026-08-02 15:25:07
北京连下六道指令,陕西硬抗整整四年,最高指示:让749局来

北京连下六道指令,陕西硬抗整整四年,最高指示:让749局来

小哥很OK
2026-01-30 15:25:18
美国前抗疫权威福奇的私密日记被公开,他内心早已断定新冠并非源于武汉市场,却对公众撒了谎

美国前抗疫权威福奇的私密日记被公开,他内心早已断定新冠并非源于武汉市场,却对公众撒了谎

人生录
2026-08-03 00:05:07
华为赛马,余承东惨败

华为赛马,余承东惨败

亿欧
2026-08-02 20:36:13
社评:亮剑!中国不会任由谁在家门口撒野

社评:亮剑!中国不会任由谁在家门口撒野

环球网资讯
2026-08-02 23:45:41
2026-08-03 13:16:49
量子位 incentive-icons
量子位
追踪人工智能动态
13073文章数 176526关注度
往期回顾 全部

科技要闻

小米多款手机涨价,店员:周六晚接到通知

头条要闻

多个省级党委领导班子调整 中央委员担任省委书记

头条要闻

多个省级党委领导班子调整 中央委员担任省委书记

体育要闻

常规赛MVP可以衡量常规赛成就吗?

娱乐要闻

奥德赛女主持递麦事件争议又升级了

财经要闻

厦门象屿青岛大火背后

汽车要闻

00后搞钱成功后的第一台车,真的不是BBA

态度原创

健康
手机
本地
旅游
公开课

中风易复发!谈中风康复与二级预防

手机要闻

2nm、固态电池、双亿影像!2026下半年六大旗舰手机配置全汇总

本地新闻

神仙也“蓉”漂,哪吒与八仙,皆是成都出品!

旅游要闻

入境游客同比增22.1%!舟山赴沪拓客源解锁海岛新机遇

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版