所有人都在构建AI记忆系统。 但我们怎么知道哪些真正有效? 随着AI智能体从一次性交互走向长期协作,记忆正成为核心能力。然而,公平地评测记忆系统却出奇地困难。 不同的系统往往使用不同的数据集、答案模型、提示词和评测方法。当最终分数发生变化时,很难判断差异究竟来自记忆系统本身,还是来自评测设置。 这正是我们打造Agent Memory Leaderboard(AML)的原因。 为什么需要一个记忆基准? 记忆不仅仅是存储对话历史。 一个有用的记忆系统,需要能够检索相关信息、跨时间连接信息、处理不断变化的状态,并为智能体的当前任务提供有用的上下文。 但此前一直缺乏一个共同的评测环境,让不同的记忆方法能在相同条件下进行比较。 AML就是为了提供这个共同场域而诞生的。 首个版本由近30所高校和研究机构联合发起,涵盖两个评测赛道。 截至2026年8月12日: - 136支团队报名参赛 - 67个代表性记忆框架完成首轮评测 - AML网站点击量突破20万 - 网站上线10天内点击量即超过10万 首期排行榜结果现已公布。 让记忆系统更具可比性 我们想解决的主要挑战之一是评测一致性。 在典型的评测设置中,记忆系统往往与特定的答案模型、提示词或裁判模型捆绑在一起评测,这使得直接比较变得困难。 更高的分数可能来自更好的记忆系统——但也可能来自更强的下游模型或不同的评测设置。 AML尝试将这几个组件分离开来。 参与记忆系统的核心接口是: 记忆系统 添加(Add)→ 搜索(Search) 记忆系统接收长期历史输入,在需要时向智能体返回检索到的相关信息。 通过统一这些交互边界,AML确保分数差异真正反映记忆能力的差距,而非评测环境的干扰。当你在排行榜上看到高分时,你可以更确信:这是记忆系统的胜利,而不是评测设置的偶然。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.