一个AI答不出的科学问题,和它答错的问题,哪个更能暴露能力短板?Apodex新发布的TRACES基准选择了前者——专门收录那些答案未必已知的困难问题。
这份基准的构建过程相当硬核:10名STEM博士花了两个月,调研了561个行业,最终整理出423个高价值真实问题,覆盖生物医学、临床转化和前沿模型工程三大领域。首席科学家@profshengwang牵头完成了配套技术报告。
![]()
为什么关注"未知答案"的问题
现有AI基准大多测试模型对已知知识的掌握程度,但科学探索的常态是面对没有标准答案的开放问题。TRACES的切入点在于评估AI的探索过程——它如何推理、如何提出假设、如何在不确定中逼近答案,而非简单地判断对错。
这种评估思路对前沿模型工程尤其有参考价值:当模型被用于辅助科研时,它的推理路径质量可能比最终结论更重要。423个问题全部来自真实行业需求,意味着测试场景并非实验室里的理想化设定。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.