Anthropic和OpenAI近期频频宣称,其模型已经能够加速AI研究,甚至接近实现自主AI研究。然而,普林斯顿大学与英国AI安全研究所(UK AI Security Institute)联合发布的一篇新论文,给出了截然不同的结论。研究团队设计了一种名为“Shadow Evaluation”(影子评估)的全新测试方法,首次让前沿AI代理尝试解决尚未公开发表的科研问题,结果发现,这些模型虽然能够胜任研究工程类任务,但在真正关键的科学决策环节上,表现远不如预期。 论文作者指出,关于自动化AI研究的种种乐观说法,一直缺乏扎实的证据。现有的评估方式要么让代理执行范围狭窄、可验证的工程任务,要么把AI生成的论文直接送去同行评审。研究团队认为,同行评审本身“过度延伸、随机性强、评审质量堪忧”,不足以衡量AI的真实研究能力。 为此,他们提出了“影子评估”方法。具体而言,每个AI代理只获得一篇未发表论文的核心研究问题,相当于“影子”研究员。而被测试的论文来自NeurIPS 2026的两篇投稿,原文作者们花费数月时间研究同一问题,随后以会议审稿人的标准对AI代理的产出进行评判。由于这些研究结果尚未出现在互联网上,AI代理无法依赖训练数据中的信息,必须真正依靠推理和实验设计来回答问题。 两项测试任务各有难度。第一项研究关注如何通过调整模型权重来引导语言模型的个性特征;第二项则围绕一种名为TabPFN的方法,该方法用于检测表格预测模型在部署阶段遇到与训练分布严重偏差的数据时,预测精度骤降的情况。这两项任务都涉及前沿研究中的开放性问题,需要代理理解问题背景、提出假设、设计实验并合理解释结果。 在主要实验中,研究团队使用了Claude Opus 4.8(Extra-High Reasoning模式),并给予每个代理六天时间、3000美元API信用额度、GPU算力预算,以及访问虚拟机和开放网络的权限。代理运行在一个脚手架(scaffold)软件环境中,该环境负责编排模型调用并提供工具支持,使模型可以委派子代理、监控自身资源使用情况,还能调用外部AI审查工具。研究者使用了OpenClaw这一开源框架来构建该环境。 实验的具体成绩尚未完全公开,但研究人员明确表示,前沿模型在处理研究工程环节——如编写代码、运行实验、整理结果——时表现良好,然而在提出有意义的研究假设、判断哪些结果真正重要、以及深入理解领域瓶颈等环节,暴露出明显不足。换句话说,AI可以成为一个高效的“技术工人”,却还远不是一名合格的“独立研究者”。 这一结果直接挑战了Anthropic和OpenAI近期的宣传口径。两家公司此前都暗示,自主AI研究即将实现,甚至可能在未来几年内带来科学突破。但普林斯顿与英国AI安全研究所的这项新研究提醒我们,真正的研究工作不仅需要大量计算和工程能力,还需要深层的科学直觉与判断力——而这些,恰恰是当前AI系统最缺乏的部分。 这篇题为“Shadow Evaluation”的论文,尚未通过同行评审,但已经引发业内讨论。许多研究者认为,这种“影子评估”范式比传统的测试集和评审更加严格,也更能反映AI在真实科研场景中的能力边界。未来,随着更多未发表论文的加入,这套评估方法或许能成为衡量AI科研能力的“试金石”。 总之,AI自主研究的梦想看起来很动人,但实验告诉我们,它仍然停留在工程辅助阶段。与其相信那些乐观的宣言,不如看看这些谨慎而扎实的评估——它们才是真正衡量技术成熟度的标尺。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.