一家名为Inherent的AI实验室公布了一项引人注目的测试结果:其研究智能体Faraday在73%的论文复现任务中击败了Anthropic和OpenAI的智能体。更让人意外的是,Faraday的取胜方式——它把OpenAI自己的模型GPT-5.5 Codex“雇”来当执行者。
这套系统的架构很有意思:一个仅有270亿参数的规划模型负责指挥,让GPT-5.5 Codex写代码、跑实验,然后检查结果、调整方案。简单说,小模型当“研究主管”,大模型当“执行研究员”。Inherent的赌注是:强大的执行能力需要有人决定什么值得执行。
![]()
但这项测试有一个关键争议点:判定Faraday获胜的裁判,本身也是AI——Inherent自家的自动化评估系统。独立专家尚未验证,Faraday学到的是真正的科学判断力,还是仅仅摸清了自家裁判的偏好。
复现任务:论文里藏着的“尸体”
Inherent构建的Replica基准测试,从100篇机器学习和AI-for-science论文中提取了310个任务。每个任务隐藏了结果图表,只提供论文正文和图表说明。智能体知道作者声称的结论,但看不到目标图。它必须推断实验设计、选择可行的方案、检查证据,失败了还要调整重来。
论文很少记录失败的配置和预算妥协,所以智能体必须在信息不完整的情况下做判断。评分标准包括:是否复现了论文声称的结果、是否遵循了方法、资源使用是否合理、有没有学术作弊。这套设计的目的是防止模型硬编码一个“好看”的结果,画一张有说服力的图就蒙混过关。
Inherent团队认为,复现任务能暴露论文中未明确写出的决策过程,对培养假设驱动的探索能力很有价值。这就像接手一家创业公司,wiki上写着“转化率提升了”——但哪个流程起了作用?数据追踪有没有问题?是某个客户群体特别买账,还是其他人都跑了?知道结果不等于知道路径。
管理层的价值:比执行层更难复制
复现任务提供了一个已知终点,这让评估比开放式探索容易得多。真正的研究可能需要判断某个问题值不值得再花一周时间——而Faraday的价值恰恰在于,它把这种“判断”变成了可复用的能力层。
如果独立团队能验证Inherent的说法,这个判断层将成为有价值的知识产权。一个能指挥更强模型、选择实验、解读结果的“研究主管AI”,可能比单纯堆参数更有商业意义。毕竟,当所有人都能用上最强的编码模型时,决定做什么实验、怎么解读结果的能力,就成了真正的护城河。
目前最大的问号仍然是:那个帮助Faraday获胜的自动化裁判,是否真的衡量了科学价值?在独立专家介入之前,73%的胜率更像是一个需要审慎对待的声明,而非定论。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.