网易首页 > 网易号 > 正文 申请入驻

Agent 记忆挑战赛正式启动:首个面向记忆系统的开放锦标赛

0
分享至


随着 Agent 从一次性问答工具走向长期协作系统,长期记忆正在成为决定其可靠性、个性化能力与工程可用性的关键基础设施。

近日,由国内外二十多所高校与研究机构联合发起的Agent Memory Leaderboard(AML)正式发布,旨在为记忆系统建立一套统一、开放、可复现、可长期运行的评测协议与公开榜单。

过去一年,Agent Memory 方法与产品快速涌现,但不同系统往往使用不同数据集、回答模型和评分规则,导致结果难以直接比较。一个系统在单一数据集上的高分,未必能说明其整体记忆能力;同一个记忆方法接入不同回答模型后,端到端表现也可能产生明显差异。由此得到的成绩,往往混合了记忆系统、回答模型和裁判规则等多方面因素的影响,难以准确衡量记忆系统本身的贡献。

在这一背景下,AML 并不试图再造一个单点 benchmark,而是将已有公开基准、平台私有测试集、标准化接入协议、统一回答流程、评审机制和公榜治理整合为一套长期运行的开放评测体系。

围绕“全面、统一、可比”的评测目标,平台形成了三项核心设计:

其一,构建覆盖文本记忆与代码记忆的多源数据体系,并以统一流程、统一回答模型和统一评审机制保障评测公平性;

其二,重构记忆能力维度,将总分拆解为分能力项的性能表现,帮助识别记忆系统在事实召回、多跳整合、时序理解、记忆治理、安全隐私等环节的真实性能差异;

其三,提供统一记忆方案接入协议,降低记忆方案的参评成本,使榜单能够持续稳定运行、不断追踪和吸纳新系统。

一、统一评测:整合多源数据,统一评测全流程

记忆系统评测要具备公信力,关键在于两点:数据覆盖是否全面,评测条件是否一致。AML 覆盖文本记忆与代码记忆场景下多源评测任务,并统一接口、回答流程和评审机制,减少单一数据集与外部变量对结果的影响,使成绩更能反映记忆系统本身的能力。

在文本记忆评测方面,AML 整合了 PersonaMem、LoCoMo-Refined、CLBench、BEAM、LongMemEval、ScriptMem 等 10余个业界主流的数据集,覆盖长对话、跨会话历史、个性化偏好、规则执行、超长上下文和剧本式连续事件等场景,合计超过 1500 个对话与任务样本、约 1.5 亿字符的长程历史、近 5000 道评测题目。更广的数据覆盖面能够降低单一场景优化带来的偶然优势,使评测结果更接近系统在真实复杂场景中的整体表现。

除文本记忆外,AML 将面向代码任务的长期记忆能力纳入评测体系。现有代码 Agent 评测通常将每个任务视为独立事件,而较少评估记忆系统能否检索并复用历史工程经验,以及这种经验复用能否提升 Agent 解决当前任务的能力。在真实软件开发场景中,开发者解决问题时往往需要参考历史 Pull Request、既有架构约定、过往修复方案和项目演化记录。AML 引入了一套面向长期工程经验的检索与复用能力评估的数据集。该代码评测数据集(暂未发布)由高校研究团队基于真实 GitHub 仓库中的软件工程任务构建并提供,覆盖 12 个仓库、150 个基础任务。对于每个基础任务,评测数据集中收集同一仓库中创建时间早于该任务的历史 Pull Request,形成 1290 个经过细粒度标注的历史任务。数据在设计上包含三项关键机制:首先,通过标注历史任务与目标任务之间的强相关、弱相关和无关关系,支持对系统抗噪能力的细粒度评估;其次,通过严格的时间约束,确保所有候选历史任务均产生于目标任务之前,从而避免未来信息泄漏;最后,通过构建三种具有不同历史规模和噪声密度的记忆环境,模拟不同真实软件开发场景,从而支持对记忆系统检索、筛选与复用历史工程经验能力的评测。


在评测流程上,AML 将参评系统的职责限定为 Add 和 Search 两类接口。Add 负责写入记忆,Search 负责返回与问题相关的记忆证据;最终回答由平台统一的 Answer 模型生成,评分由平台统一的 Eval 流程完成。通过固定回答模型、评分流程和聚合规则等关键变量,平台能够更大程度地将成绩差异归因于记忆系统本身。

评分环节则采用多评审评分系统(Multi-Agent Judging System)。平台会根据题目来源、能力标签和答案类型,将题目路由到相应评审流程:事实召回类题目检查关键事实是否命中,多跳类题目检查分散证据是否被正确整合,时序类题目检查新旧状态判断是否准确,安全类题目检查系统是否守住证据与隐私边界;代码任务则以测试用例通过情况进行客观判定。平台还会统一封装模型、参数、日志和聚合规则,并使用人工标注样本校准评分规则,保留检索证据、平台答案和评审记录,以提升评测结果的可解释性与可追溯性。

因此,AML 的统一评测并不是简单扩大测试集规模,而是通过“全面数据覆盖、固定评测链路、多评审评分机制”,把不同记忆系统放到同一把尺子下比较。


二、能力剖面:重构能力维度,呈现系统真实差异

单一总分很难解释记忆系统的真实差异。为了解决“排名可见、原因不可见”的问题,AML 将不同来源的数据重新映射到统一能力维度中,把评测结果从单一分数扩展为可解释的能力剖面。

现有公开数据集本身具有重要价值,但其任务设计和能力标签并不统一。有的数据集强调长程事实召回,有的强调偏好与个性化,有的关注时间线,有的侧重规则执行或拒答安全。如果只是将这些数据集简单拼接,最终得到的往往是混合分数,难以为研究迭代和产品选型提供清晰依据。

为此,AML 对收录题目的能力标签进行了人工重构,将原本分散在不同数据集中的题目映射到同一套能力维度体系。这套维度沿着记忆使用链路展开:一条信息要成为可用记忆,首先要被精准召回,其次要被正确理解,最后还要在合适边界内稳定使用。基于这一链路,平台将文本记忆归并为七类能力:显式事实召回、关系与多跳组合、时间与事件序列、记忆治理、个性化与关怀、规则与流程执行、认识论安全与隐私。


代码记忆同样纳入这套能力坐标,重点评估系统能否从历史工程记录中检索、筛选并复用有效经验,主要包括两类任务:

Debug Memory:考察记忆系统能否从历史记录中检索出相似问题的修复经验,帮 Agent 复用定位思路、修改方案和验证方法;

Development Memory:考察能否从历史开发记录中提取架构设计与既有工程模式,帮 Agent 生成符合项目设计的修改。

经过这一重构,LoCoMo、BEAM、LongMemEval 等不同来源的数据不再只是并列出现,而是被组织进同一套能力坐标。参评者最终得到的也不只是一个名次,而是一张能力剖面图:它能够呈现系统在事实召回、多跳整合、时序理解、记忆治理、个性化、安全隐私等维度上的具体表现。

这意味着,AML 提供的不只是一个排行榜,而是一套诊断工具。对研究者而言,能力剖面能够定位方法短板;对产品团队而言,它可以帮助判断系统是否适合具体应用场景;对行业用户而言,它让“记忆能力强”从笼统宣传变成可核验的分项证据。

三、低门槛统一接入:支撑开放榜单长期运行

一个评测平台要成为长期基础设施,关键不只是数据和评分规则,还要让不同类型的系统能够持续接入、反复复现、长期比较。过去许多评测难以延续,一个重要原因在于接入成本高、系统形态差异大、版本记录不完整,导致新方法和商业产品很难在同一套规则下持续积累结果。

AML 因此将参评系统的技术要求压缩为 Add 和 Search 两类核心接口。参评方只需负责记忆写入与检索,回答生成、评分、结果聚合和评测编排均由平台统一完成。这一协议设计使不同类型的参评方都能进入同一套评测体系。商业产品可以通过稳定 API 参评,无需公开内部实现;开源方法则提交代码、运行方式和版本材料,由平台按规则复现或托管运行。对参评方而言,接入重点从搭建完整评测环境转为提供稳定、规范的记忆写入与检索能力。

统一接口也使榜单能够持续吸纳新系统。每条成绩与系统版本绑定,评测日志与结果长期可追溯;不同时间加入的系统,也可以在同一套条件下进行比较。在既有基准之外,AML 还接受社区贡献的新 Benchmark——平台鼓励大家提交与现有评测形成互补、具备区分度的完整测试集,经审核后可纳入平台评测体系。

因此,AML 统一了评测入口、执行流程和治理规则,既保留了不同记忆系统的创新空间,也为开放榜单的长期运行提供了制度基础。

首届 Agent 记忆挑战赛 2026

由 Agent Memory Leaderboard 平台主办的首届 Agent 记忆挑战赛已于 2026 年 7 月 29 日启动,本次挑战赛面向全球研究者、开源项目维护者和商业产品团队征集参评系统,旨在为社区提供第一批可比较、可复核的公开评测结果。

赛事榜单分类开源方法榜单:面向开源研究方法,成绩与代码、配置和复现材料绑定,参与排名与奖励结算。
商业产品榜单:面向以稳定 API 提供的商业记忆产品,独立排名,为行业提供选型参照。

研究者、开源项目维护者、产品团队和正在做技术选型的开发者,都可以提交系统参与评测。不设组队要求。

参赛流程说明

报名申请:填写报名表单,审核通过后获取评测 API Key;

接口接入:按平台协议提供公网可访问的 Add/Search 接口;

提交评测:通过 smoke 兼容性测试确认链路后,提交正式评测任务;

复核上榜:评测结果经复核后进入公开榜单。

平台统一承担 Answer、Eval 与评测编排成本;参赛方承担自身 API、数据库、带宽和计算成本,参赛者无需自行搭建评测环境。

奖励设置

上榜奖励(开源方法榜,每期结算)

第 1—3 名:某顶级模型 Pro 月度会员(价值 ¥1,400)

第 4—10 名:某顶级模型 Plus 月度会员(价值 ¥140)

社区贡献计划(满足任一条件即可入选,瓜分百亿级 Token 奖励)

前 50 位完成有效提交的参赛者,每人获得价值 50 元人民币的 API 额度;

每成功邀请 3 位新参赛者完成有效提交,同样获得价值 50 元人民币的 API 额度。

我们也欢迎贡献有挑战性的测试样本,提交 3 个有挑战性的测试数据,同样获得价值 50 元人民币的 API 额度!


赛事日程与联系方式

报名开放:2026 年 7 月 29 日

提交截止:2026 年 8 月 7 日

放榜日期:2026 年 8 月中旬

赛制:本次为首届赛事。Agent Memory Leaderboard 长期运行,后续赛事另行公告

报名入口:

https://agentmemories.ai/competition/

赛事仓库:

https://github.com/AML-memory/agent-memory-leaderboard (含接口协议、提交指南与接入示例)

答疑邮箱:

contactus@agentmemoryleaderboard.ai

2 个工作日内响应

记忆技术要往前走,需要一套大家认可、任何人都能核验的度量衡。

8 月中旬,我们榜单见。

--end--

最后记得⭐️我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论

/...@作者:你说的完全正确(YAR师)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
国民党不装了!主动提出统一方案,赖清德万万没想到这一天来了!

国民党不装了!主动提出统一方案,赖清德万万没想到这一天来了!

顾秋韵
2026-08-06 14:25:44
WTT冠军赛捷报:女单爆大冷!蒯曼剃光头,王艺迪大战伊藤美诚!

WTT冠军赛捷报:女单爆大冷!蒯曼剃光头,王艺迪大战伊藤美诚!

画夕
2026-08-07 14:50:43
难怪最高领袖躲在地堡,伊朗最大女内鬼落网,哈梅内伊死得太冤了

难怪最高领袖躲在地堡,伊朗最大女内鬼落网,哈梅内伊死得太冤了

共工之锚
2026-08-07 00:09:52
央视主播杜宪:曾低谷时嫁给陈道明,41年后再看,到底有多幸福

央视主播杜宪:曾低谷时嫁给陈道明,41年后再看,到底有多幸福

杰丝聊古今
2026-07-19 00:17:03
张一鸣罕见发声背后的模型蒸馏之辩

张一鸣罕见发声背后的模型蒸馏之辩

蓝鲸新闻
2026-08-06 21:22:08
太可怕了!西班牙专家称地球正在变暗,升温速度远超预期

太可怕了!西班牙专家称地球正在变暗,升温速度远超预期

安逸安逸
2026-07-26 09:07:56
台湾统派四大梯队排名出炉!洪秀柱扛大旗

台湾统派四大梯队排名出炉!洪秀柱扛大旗

杰丝聊古今
2026-08-06 01:59:01
韩杰判刑后,3名儿科医生走了2个!"关掉科室,全院都松了口气"

韩杰判刑后,3名儿科医生走了2个!"关掉科室,全院都松了口气"

医脉圈
2026-08-06 23:24:25
Apple Watch Ultra 4 功能曝光:血压监测与运动追踪双重升级

Apple Watch Ultra 4 功能曝光:血压监测与运动追踪双重升级

数码Antenna
2026-08-07 12:39:28
浓眉与奇才确定推迟续约!约定先打完前20场再议 双方要互相评估

浓眉与奇才确定推迟续约!约定先打完前20场再议 双方要互相评估

罗说NBA
2026-08-07 06:07:33
日本发出强硬警告,如果中国继续实施导弹试射,我们就加速拥核!

日本发出强硬警告,如果中国继续实施导弹试射,我们就加速拥核!

棠棣分享
2026-08-03 12:40:15
7个女人都没拴住的风流才子,为何栽在50岁寡妇手里?

7个女人都没拴住的风流才子,为何栽在50岁寡妇手里?

阿天爱旅行
2026-07-29 18:27:10
“美对华鹰派高官寻求访华,坐了中方冷板凳”

“美对华鹰派高官寻求访华,坐了中方冷板凳”

观察者网
2026-08-07 21:03:19
阿森纳曼联齐追21岁国米妖星,球员已同意续约至2031

阿森纳曼联齐追21岁国米妖星,球员已同意续约至2031

篮坛第一线
2026-08-07 21:00:50
江宇涵封神一战,U17国足点球大战淘汰河床晋级决赛,太给力了

江宇涵封神一战,U17国足点球大战淘汰河床晋级决赛,太给力了

姜大叔侃球
2026-08-07 21:57:24
歌手2026总决赛:韩磊气场盖过胡彦斌,网友直言分不清谁是帮唱?

歌手2026总决赛:韩磊气场盖过胡彦斌,网友直言分不清谁是帮唱?

很哥
2026-08-07 22:26:41
看到皇马成功签约迪奥曼德,最不开心的球员,当属以下四位

看到皇马成功签约迪奥曼德,最不开心的球员,当属以下四位

冷桂零落
2026-08-07 00:11:30
“穷人的命不值钱”,农民工讨要180块工钱未果,将老板活活砍死

“穷人的命不值钱”,农民工讨要180块工钱未果,将老板活活砍死

易玄
2026-08-05 10:56:49
新冠确诊的人越来越多?医生再次强调:宁可喝冰水,也别做这9事

新冠确诊的人越来越多?医生再次强调:宁可喝冰水,也别做这9事

纸上的心语
2026-08-07 09:31:04
有个体态娇小的妻子是什么体验?网友:终于知道腰间盘为啥突出了

有个体态娇小的妻子是什么体验?网友:终于知道腰间盘为啥突出了

夜深爱杂谈
2026-08-05 21:13:33
2026-08-07 23:16:49
呼呼历史论
呼呼历史论
分享有趣的历史
788文章数 17751关注度
往期回顾 全部

科技要闻

突然涨价,"只收电费钱"的梁文锋,变了吗

头条要闻

穆杰塔巴被指给总统下"最后警告" 爆料人发声意味深长

头条要闻

穆杰塔巴被指给总统下"最后警告" 爆料人发声意味深长

体育要闻

去年信誓旦旦3000万 今年NBA查无此人

娱乐要闻

周也热恋结束,六个字暴露单身状态

财经要闻

腾讯WorkBuddy领跑AI办公 阿里字节急了?

汽车要闻

越7全球首秀 传祺开始进攻方盒子越野

态度原创

家居
艺术
时尚
教育
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

冉茂芹风景与静物油画 19幅

工装,好穿又有质感!

教育要闻

《北京市中小学教育惩戒规则实施细则(试行)》印发

军事要闻

乌防空导弹严重短缺 泽连斯基公开喊话

无障碍浏览 进入关怀版