网易首页 > 网易号 > 正文 申请入驻

让AI无提示裸考,十余所机构联合发布全新基准:自主科研能力还有多远?

0
分享至



近两年,AI for Science 持续升温。大模型在蛋白质折叠、数学推导、材料模拟等科研任务中不断交出亮眼答卷,各类评测榜单上前沿模型分数屡创新高。GPT、Claude 等主流模型搭配 harness,看似已经具备比肩科研人员的能力。

但一个关键问题是:AI 完成一项科研任务,究竟意味着它会做研究,还是只是擅长执行人类已经设计好的研究方案?

为衡量 AI 的科学自主性——在没有人类方法论指导的情况下,AI 能自主完成多少真实科研工作。清华大学人工智能学院助理教授陈勇超联合全球科学家团队,携手麻省理工学院、哈佛大学、卡内基梅隆大学、中国科学技术大学、微软研究院等十余所机构开发了一个名为 ASI-Bench 的全新测试基准,试图专门测量这其中的差别。

这里的 ASI 指的是人工超级智能(Artificial Superintelligence)。在研究团队看来,通往 ASI 的关键,不只是让 AI 更擅长解决已有问题,而是让它能够走出现有人类知识和既定研究流程,探索未知、创造新知识,并把新的想法转化为可以验证的科研结果。

因此,与其不断给 AI 出更难的题,研究团队采用了另一种办法:针对同一个科研项目,逐步减少人类提供的方法和操作步骤,观察 AI 的能力会从哪里开始下降。

实验结果显示,18 种模型与智能体系统组合在获得完整方法指导时,平均得到 50.91 分;拿走具体步骤,只留下方法名称,平均分降到 29.10;连方法名称也拿走,只给研究目标和原始数据,平均分进一步降到 26.62。

也就是说,真正让 AI 成绩大幅下降的,并不是要求它自主选择研究方法,而是当人类撤掉具体操作步骤、只保留方法提示时。

同一个科研项目,让 AI 做四遍

与此前评测相比,ASI-Bench 试图测量的不是某一种单独的能力。比如,Humanity’s Last Exam(HLE)主要考察高难度知识与推理,Terminal-Bench 更侧重工具使用和长程任务执行,ScienceAgentBench 则关注数据驱动的科学分析。这些基准分别覆盖了科研能力的一部分,但大多在固定任务说明下进行,很难进一步判断 AI 的成功有多少依赖于人类已经提供的研究方法。

ASI-Bench 的不同之处,是把人类指导程度本身变成一个变量。研究团队为每个任务准备了 B1 到 B4 四个不同的指导条件。四个版本使用相同的研究目标、输入数据、输出要求和评分标准,唯一变化的是:人类告诉 AI 的提示越来越少。

B1 最接近一份完整的研究说明书。研究方法、公式、实现步骤甚至部分参数选择都会直接提供,AI 主要负责把方案正确实现出来;到了 B2,详细步骤被拿掉,只保留方法层面的提示。也就是说,人类告诉 AI 应该走哪条技术路线,但如何把方法变成一套可运行的方案,需要它自己完成。

B3 则进一步撤掉方法提示,只留下研究目标、数据、约束和需要提交的结果,模型必须自行判断应该采用什么方法,并完成后续实现和验证。B4 与 B3 基本相同,但会额外加入一些事实正确、却与当前任务无关的信息,用来观察 AI 是否容易被干扰。

B1 到 B3 之间的分数差距越大,说明系统越依赖人类提供的研究方案。


(来源:上述论文)

为了让这种比较尽量可靠,研究团队最初收集了 1,300 多个候选科研问题,经过 5 轮、超过 1,100 次人工评审和 2,000 多次修订,最终精选出 60 道完整科研项目,覆盖数学、物理、化学、生物、天文、材料、地球科学、医学/生物统计、计算机、机器人、电子工程 11 个基础与工程学科。

开发过程中,研究团队还进行了超过 1,500 次沙盒运行,检查参考结果能否复现、评分是否稳定,以及是否存在信息泄漏或可以绕过正常研究过程的“捷径”。整个基准的构建和验证累计投入超过 3.1 万个人工小时,以尽可能确保这 60 个任务真正测到的是科研能力,而不是模型对题目的投机适配。

也正是在这套逐步撤掉提示的设置下,一个颇为反直觉的结果出现了:AI 的最大性能断层,并没有发生在完全需要自己选择研究方法的 B3,而是在更早的 B1 到 B2 之间。

AI 自主科研,卡的不只是模型能力

研究团队随后测试了 18 种 harness 与模型的组合。使用的 harness 包括 Codex、Claude Code、Kimi Code、MiMo Code 和 OpenHands,搭配 GPT-5.5、GPT-5.6 Sol、Claude Opus、Kimi、DeepSeek、GLM、MiniMax、MiMo 等模型。

结果显示,随着人类指导逐渐减少,AI 的科研表现明显下降:B1 平均得分为 50.91,B2 降至 29.10,B3 进一步降到 26.62,加入干扰信息后的 B4 为 26.99。


(来源:上述论文)

最明显的结果出现在 B1 到 B2 之间。从 B1 到 B2,研究目标和方法都没有改变,人类只是撤掉了具体的实现步骤,平均成绩就从 50.91 降到了 29.10,下降了 21.82 分。相比之下,从 B2 到 B3,连应该采用什么方法也不再告诉 AI,成绩却只下降了 2.48 分。

即使是本次测试中表现最好的配置也存在明显差距。Codex 搭配 GPT-5.6 Sol(ultra)在 B1 中得到 71.78 分,到了需要自行选择方法的 B3 仍有 51.60 分,是所有组合中唯一超过 50 分的 B3 成绩,但相比 B1 依然下降了约 20 分。

也就是说,AI 最大的性能下降,并没有发生在需要自己选择研究方法的时候,而是发生在人类不再提供具体研究流程、只告诉它该用什么方法之后。

除此之外,论文还发现了几个比较有意思的现象。

首先,更强的推理确实能够提升自主科研表现,但代价不低。在 Codex 框架下,GPT-5.6 Sol 从 xhigh 提升到 ultra 后,B3 得分由 40.86 升至 51.60,增加了 10.74 分,说明增加推理预算确实有助于 AI 在缺少方法指导时完成更复杂的研究任务。

其次,Agent 框架也会显著影响模型最终表现。同一个底层模型换用不同 harness,成绩可能相差不少。例如,MiMo V2.5 Pro 搭配 MiMo Code 时总体得分为 16.17,换成 Claude Code 后升至 23.25;Kimi K2.7 也从 19.72 提升到 27.34。这意味着,科研能力并不是模型单独决定的,而是模型和系统共同作用的结果。

计算成本的结果同样有些反直觉。获得完整方法学指导的 B1,反而是成本最低的设置。 B1 平均每个任务消耗约 435 万 token,运行 37.8 分钟。由于研究方法、实现步骤和参数选择都已基本明确,AI 只需要按照既定流程执行,不必进行大量搜索和试错。

到了 B2,人类只告诉 AI 应该采用什么方法,却不再提供具体实现步骤,成本反而升至最高:平均每个任务消耗 691 万 token、运行 49.7 分钟,较 B1 分别增加 59% 和 32%。原因在于,AI 一方面受到既定方法的约束,另一方面又必须自行补齐求解、参数设置和调试等大量细节,因此需要更多探索和迭代。

相比之下,完全撤掉方法提示的 B3、B4,平均 token 消耗约为 540 万和 570 万,反而低于 B2。这说明,不完整的人类指导未必能够降低科研成本,有时反而会增加额外的搜索负担。

这给正在推进 auto research 的团队一个重要信号:与其只给 AI 一个方向,再让它自行补全后续流程,不如要么提供足够完整的指导,让 AI 高效执行;要么减少路线限制,让系统自行探索并完成研究。


(来源:上述论文)

当然,ASI-Bench 的意义并不只是给不同模型排出名次,而是为不同类型的 AI 科研系统提供了一套更有针对性的能力检验方式。

对于新的基础模型或推理系统,ASI-Bench 尤其是 B3 这类“只给目标、不提供方法”的低指导条件,可以进一步检验模型是否真正具备更强的科学推理和自主研究能力。

对于 AI Scientist 或 AI for Science 系统,B1–B4 也可以作为一套诊断工具:B1 到 B2 降幅大,说明系统依赖完整操作流程;B2 到 B3 降幅大,则说明方法选择仍是短板;B3 与 B4 的差异,则反映系统面对干扰信息时的鲁棒性。

对于 Agent 或 Harness 开发者,同一底层模型搭配不同框架的表现差异,也能帮助判断性能提升究竟来自模型本身,还是任务规划、代码执行等系统设计。

目前 ASI-Bench 仍远未饱和,18 组配置在 B3 上平均只有 26.62 分,最高为 51.60。因此,未来任何在低指导条件下取得的稳定提升,都可以作为衡量 AI 自主科研能力进展的重要参照。

但真实科研远比这 60 个任务复杂,研究团队也因此把 ASI-Bench 设计成一个持续更新的开放基准,未来还会不断加入新的学科和任务。它更像是一把动态的尺子,用来观察随着人类指导逐渐减少,AI 能否越来越独立地完成方法选择、研究执行和结果验证。至于这是否意味着 AGI 或 ASI 正在到来,单一评测显然无法回答,但至少它把“AI 到底能不能自己做研究”这个过去较为模糊的问题,变成了一个可以持续比较的指标。

1.https://arxiv.org/abs/2608.17271

2.任务贡献:https://asibench.apexin.ai/submit

3.GitHub:https://github.com/apexin-ai/ASI-Bench

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
快讯!俄罗斯传来消息!

快讯!俄罗斯传来消息!

故事终将光明磊落
2026-08-19 13:33:03
价值约7300亿美元,100亿桶新发现?巴西总统卢拉说石油是巴西未来通行证,“它真好,闻起来也不错”

价值约7300亿美元,100亿桶新发现?巴西总统卢拉说石油是巴西未来通行证,“它真好,闻起来也不错”

每日经济新闻
2026-08-19 16:56:42
没想到,小泉拜完靖国神社,首个出来指责的不是中方,竟是自家人

没想到,小泉拜完靖国神社,首个出来指责的不是中方,竟是自家人

云上乌托邦
2026-08-19 13:53:42
福克斯为《牛来》下架发声!

福克斯为《牛来》下架发声!

SwagFuck
2026-08-19 01:04:18
独家披露:韩铠伊冒死给慈善家李春平生儿子!身边人毒计迭出

独家披露:韩铠伊冒死给慈善家李春平生儿子!身边人毒计迭出

细品名人
2026-08-19 08:56:47
旺旺官宣 “听劝版” 新品即将上线,主打低糖、低脂、高钙,还将上线250mL规格;此前曾被网友集体呼吁减糖

旺旺官宣 “听劝版” 新品即将上线,主打低糖、低脂、高钙,还将上线250mL规格;此前曾被网友集体呼吁减糖

大风新闻
2026-08-19 22:09:20
汇丰要求部分内地存量投资客户提交资金来源声明,未及时提交或将终止相关服务,汇丰回应!

汇丰要求部分内地存量投资客户提交资金来源声明,未及时提交或将终止相关服务,汇丰回应!

每日经济新闻
2026-08-19 18:21:45
灌女下属半斤茅台拖进KTV猥亵,杭州副区长玩潜规则,谁给的胆子

灌女下属半斤茅台拖进KTV猥亵,杭州副区长玩潜规则,谁给的胆子

天天热点见闻
2026-08-19 08:30:22
窦佳嫄罕见谈父亲窦唯:20岁前无沟通,收到他的红包妈妈流泪了!

窦佳嫄罕见谈父亲窦唯:20岁前无沟通,收到他的红包妈妈流泪了!

玖宇维
2026-08-19 15:24:42
拼多多存在的意义具象化了,网友:没有比这个更震撼想哭的了!

拼多多存在的意义具象化了,网友:没有比这个更震撼想哭的了!

另子维爱读史
2026-08-18 21:06:29
韩旭创WNBA历史第2人纪录:单季替补30三分+20帽 难阻自由人惜败

韩旭创WNBA历史第2人纪录:单季替补30三分+20帽 难阻自由人惜败

醉卧浮生
2026-08-19 11:05:54
马斯克直呼完了:Anthropic 73页论文刷屏,全球大模型中招思想病毒!

马斯克直呼完了:Anthropic 73页论文刷屏,全球大模型中招思想病毒!

新智元
2026-08-19 20:52:37
李嫣大概是上天派下来的天使吧,用自己的人生照亮了无数人的路

李嫣大概是上天派下来的天使吧,用自己的人生照亮了无数人的路

娱你同欢
2026-08-19 20:42:04
28岁骑手身亡!组团强闯厚街收费站驶入广深高速!

28岁骑手身亡!组团强闯厚街收费站驶入广深高速!

东莞好生活
2026-08-19 00:19:26
王兴兴:每天三分之一时间管公司,2018年账面仅剩10多万,用积蓄给员工发工资,回应“价格屠夫”:没到那个程度,毛利总体来说是合理的

王兴兴:每天三分之一时间管公司,2018年账面仅剩10多万,用积蓄给员工发工资,回应“价格屠夫”:没到那个程度,毛利总体来说是合理的

金融界
2026-08-19 11:19:43
立秋后,茄子黄瓜靠边站,多吃这3道“高钾菜”,不困不乏,好吃

立秋后,茄子黄瓜靠边站,多吃这3道“高钾菜”,不困不乏,好吃

阿龙美食记
2026-08-18 15:39:48
传奇大佬,从30楼坠亡

传奇大佬,从30楼坠亡

南风窗
2026-08-19 14:07:00
杭州酒局事件另一关键人物被停职调查,知情人发声:事发后网传大量不实信息,受害女生为此一度情绪崩溃

杭州酒局事件另一关键人物被停职调查,知情人发声:事发后网传大量不实信息,受害女生为此一度情绪崩溃

扬子晚报
2026-08-19 22:14:53
杭州酒局事件:招商蛇口赵海峰是真流氓,建发总经理献祭女员工乃真小人

杭州酒局事件:招商蛇口赵海峰是真流氓,建发总经理献祭女员工乃真小人

Mr王的饭后茶
2026-08-19 08:06:04
163欧元“空调”被德国权威测试拆穿:里面只有PC风扇和加热元件,冷风模式不降温

163欧元“空调”被德国权威测试拆穿:里面只有PC风扇和加热元件,冷风模式不降温

硅屿手记
2026-08-17 17:45:51
2026-08-20 00:08:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17101文章数 515194关注度
往期回顾 全部

科技要闻

宇树的悬念还在后面

头条要闻

"三孩非亲生"男子:孩子已交接 回去烧掉结婚照结束了

头条要闻

"三孩非亲生"男子:孩子已交接 回去烧掉结婚照结束了

体育要闻

拥有“儿皇梦”的罗德里,为何选择巴萨?

娱乐要闻

章子怡财路遭到质疑,套现3亿冲上热搜

财经要闻

内部反腐,让大疆错过宇树250亿收益?

汽车要闻

小米澎程N70体验 后排空间夸张亦可旋转对坐

态度原创

家居
房产
手机
教育
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

涉及3800亩!海口秀英港又有大动作!

手机要闻

正面对决!小米玄戒O3 9月上旬登场:发布档期紧邻iPhone 18 Pro

教育要闻

看完“龙餐馆”,一定要告诉孩子这三件事

军事要闻

美国防部:正在落实总统缩减美韩军演指令

无障碍浏览 进入关怀版