AI评测领域迎来一个新变量。近日,一个名为TRACES的基准正式对外发布,定位为全球首个用于衡量"发现式智能"(discoverative AI)的评测体系。与当前主流基准不同,TRACES关注的不是AI能否找到已知答案,而是它能否独立走完一条完整的科学发现路径。
从"检索"到"发现"的评测转向
![]()
当前绝大多数AI基准测试的核心逻辑是"检索"——给定一个问题,看模型能否从已有知识库中找出正确答案。这类评测对衡量AI的记忆与调用能力有效,但科学前沿的难题往往没有现成答案。TRACES试图回答一个更进阶的问题:一个系统能否通过自主探索,获得一个此前无人得出的结论?
这一转向将AI能力的评估从"已知答案的复现"推向"未知领域的开拓",对科研辅助、药物研发、材料发现等依赖原创性突破的领域具有直接参考意义。
六阶段分解:把"发现"变成可工程化的动词
TRACES的核心贡献在于将抽象的"发现"过程拆解为可量化、可追踪的六个阶段:
- Ambition(目标设定):系统能否自主提出有价值的研究方向
- Formulation(问题构建):能否将方向转化为可执行的具体问题
- Action(行动执行):能否设计并实施实验或计算步骤
- Observation(观察记录):能否准确捕捉并记录过程数据
- Verification(验证核验):能否对结果进行有效性检验
- Repair(修正迭代):能否识别错误并调整策略继续推进
这一分解框架的意义在于,它将"发现"从一个模糊的能力描述,转化为可逐项评估的工程指标。正如发布者所言,这种分解方式本身可能比任何单一基准分数都更重要——它定义了"发现式智能"的可操作标准。
评测逻辑:能否走完完整研究弧线
TRACES的评测核心在于考察AI系统能否维持从"目标"到"证据"再到"验证与修正"的完整研究弧线。这意味着系统不仅要在某个环节表现出色,更要在整个链条上保持连贯性与自我纠错能力。一个只擅长提出假设却无法验证的系统,或一个能执行实验却无法从失败中修正策略的系统,都难以在TRACES框架下获得高分。
这种端到端的评测思路,与科研工作的实际流程高度吻合,也为AI在科学发现场景中的应用提供了更贴近现实的衡量标尺。
对AI发展方向的潜在影响
TRACES的发布,为AI评测体系开辟了一个新的维度。过去几年,AI能力的提升主要靠规模与算力驱动,评测标准也多围绕已有任务的完成度展开。而发现式智能的提出,将注意力引向AI在未知领域的自主探索能力——这恰恰是基础科学研究最需要、也最难被现有基准覆盖的部分。
对于关注AI前沿应用的从业者而言,TRACES提供了一个观察窗口:当AI不再只是"答题者",而是开始扮演"研究者"角色时,我们如何判断它是否真正具备科学发现的能力?这个基准的答案,或许会为下一代AI系统的设计方向提供参考。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.