网易首页 > 网易号 > 正文 申请入驻

让AI无提示裸考,十余所机构联合发布全新基准:自主科研能力还有多远?

0
分享至

来源:市场资讯

(来源:DeepTech深科技)


近两年,AI for Science 持续升温。大模型在蛋白质折叠、数学推导、材料模拟等科研任务中不断交出亮眼答卷,各类评测榜单上前沿模型分数屡创新高。GPT、Claude 等主流模型搭配 harness,看似已经具备比肩科研人员的能力。

但一个关键问题是:AI 完成一项科研任务,究竟意味着它会做研究,还是只是擅长执行人类已经设计好的研究方案?

为衡量 AI 的科学自主性——在没有人类方法论指导的情况下,AI 能自主完成多少真实科研工作。清华大学人工智能学院助理教授陈勇超联合全球科学家团队,携手麻省理工学院、哈佛大学、卡内基梅隆大学、中国科学技术大学、微软研究院等十余所机构开发了一个名为 ASI-Bench 的全新测试基准,试图专门测量这其中的差别。

这里的 ASI 指的是人工超级智能(Artificial Superintelligence)。在研究团队看来,通往 ASI 的关键,不只是让 AI 更擅长解决已有问题,而是让它能够走出现有人类知识和既定研究流程,探索未知、创造新知识,并把新的想法转化为可以验证的科研结果。

因此,与其不断给 AI 出更难的题,研究团队采用了另一种办法:针对同一个科研项目,逐步减少人类提供的方法和操作步骤,观察 AI 的能力会从哪里开始下降。

实验结果显示,18 种模型与智能体系统组合在获得完整方法指导时,平均得到 50.91 分;拿走具体步骤,只留下方法名称,平均分降到 29.10;连方法名称也拿走,只给研究目标和原始数据,平均分进一步降到 26.62。

也就是说,真正让 AI 成绩大幅下降的,并不是要求它自主选择研究方法,而是当人类撤掉具体操作步骤、只保留方法提示时。

同一个科研项目,让 AI 做四遍

与此前评测相比,ASI-Bench 试图测量的不是某一种单独的能力。比如,Humanity’s Last Exam(HLE)主要考察高难度知识与推理,Terminal-Bench 更侧重工具使用和长程任务执行,ScienceAgentBench 则关注数据驱动的科学分析。这些基准分别覆盖了科研能力的一部分,但大多在固定任务说明下进行,很难进一步判断 AI 的成功有多少依赖于人类已经提供的研究方法。

ASI-Bench 的不同之处,是把人类指导程度本身变成一个变量。研究团队为每个任务准备了 B1 到 B4 四个不同的指导条件。四个版本使用相同的研究目标、输入数据、输出要求和评分标准,唯一变化的是:人类告诉 AI 的提示越来越少。

B1 最接近一份完整的研究说明书。研究方法、公式、实现步骤甚至部分参数选择都会直接提供,AI 主要负责把方案正确实现出来;到了 B2,详细步骤被拿掉,只保留方法层面的提示。也就是说,人类告诉 AI 应该走哪条技术路线,但如何把方法变成一套可运行的方案,需要它自己完成。

B3 则进一步撤掉方法提示,只留下研究目标、数据、约束和需要提交的结果,模型必须自行判断应该采用什么方法,并完成后续实现和验证。B4 与 B3 基本相同,但会额外加入一些事实正确、却与当前任务无关的信息,用来观察 AI 是否容易被干扰。

B1 到 B3 之间的分数差距越大,说明系统越依赖人类提供的研究方案。


(来源:上述论文)

为了让这种比较尽量可靠,研究团队最初收集了 1,300 多个候选科研问题,经过 5 轮、超过 1,100 次人工评审和 2,000 多次修订,最终精选出 60 道完整科研项目,覆盖数学、物理、化学、生物、天文、材料、地球科学、医学/生物统计、计算机、机器人、电子工程 11 个基础与工程学科。

开发过程中,研究团队还进行了超过 1,500 次沙盒运行,检查参考结果能否复现、评分是否稳定,以及是否存在信息泄漏或可以绕过正常研究过程的“捷径”。整个基准的构建和验证累计投入超过 3.1 万个人工小时,以尽可能确保这 60 个任务真正测到的是科研能力,而不是模型对题目的投机适配。

也正是在这套逐步撤掉提示的设置下,一个颇为反直觉的结果出现了:AI 的最大性能断层,并没有发生在完全需要自己选择研究方法的 B3,而是在更早的 B1 到 B2 之间。

AI 自主科研,卡的不只是模型能力

研究团队随后测试了 18 种 harness 与模型的组合。使用的 harness 包括 Codex、Claude Code、Kimi Code、MiMo Code 和 OpenHands,搭配 GPT-5.5、GPT-5.6 Sol、Claude Opus、Kimi、DeepSeek、GLM、MiniMax、MiMo 等模型。

结果显示,随着人类指导逐渐减少,AI 的科研表现明显下降:B1 平均得分为 50.91,B2 降至 29.10,B3 进一步降到 26.62,加入干扰信息后的 B4 为 26.99。


(来源:上述论文)

最明显的结果出现在 B1 到 B2 之间。从 B1 到 B2,研究目标和方法都没有改变,人类只是撤掉了具体的实现步骤,平均成绩就从 50.91 降到了 29.10,下降了 21.82 分。相比之下,从 B2 到 B3,连应该采用什么方法也不再告诉 AI,成绩却只下降了 2.48 分。

即使是本次测试中表现最好的配置也存在明显差距。Codex 搭配 GPT-5.6 Sol(ultra)在 B1 中得到 71.78 分,到了需要自行选择方法的 B3 仍有 51.60 分,是所有组合中唯一超过 50 分的 B3 成绩,但相比 B1 依然下降了约 20 分。

也就是说,AI 最大的性能下降,并没有发生在需要自己选择研究方法的时候,而是发生在人类不再提供具体研究流程、只告诉它该用什么方法之后。

除此之外,论文还发现了几个比较有意思的现象。

首先,更强的推理确实能够提升自主科研表现,但代价不低。在 Codex 框架下,GPT-5.6 Sol 从 xhigh 提升到 ultra 后,B3 得分由 40.86 升至 51.60,增加了 10.74 分,说明增加推理预算确实有助于 AI 在缺少方法指导时完成更复杂的研究任务。

其次,Agent 框架也会显著影响模型最终表现。同一个底层模型换用不同 harness,成绩可能相差不少。例如,MiMo V2.5 Pro 搭配 MiMo Code 时总体得分为 16.17,换成 Claude Code 后升至 23.25;Kimi K2.7 也从 19.72 提升到 27.34。这意味着,科研能力并不是模型单独决定的,而是模型和系统共同作用的结果。

计算成本的结果同样有些反直觉。获得完整方法学指导的 B1,反而是成本最低的设置。 B1 平均每个任务消耗约 435 万 token,运行 37.8 分钟。由于研究方法、实现步骤和参数选择都已基本明确,AI 只需要按照既定流程执行,不必进行大量搜索和试错。

到了 B2,人类只告诉 AI 应该采用什么方法,却不再提供具体实现步骤,成本反而升至最高:平均每个任务消耗 691 万 token、运行 49.7 分钟,较 B1 分别增加 59% 和 32%。原因在于,AI 一方面受到既定方法的约束,另一方面又必须自行补齐求解、参数设置和调试等大量细节,因此需要更多探索和迭代。

相比之下,完全撤掉方法提示的 B3、B4,平均 token 消耗约为 540 万和 570 万,反而低于 B2。这说明,不完整的人类指导未必能够降低科研成本,有时反而会增加额外的搜索负担。

这给正在推进 auto research 的团队一个重要信号:与其只给 AI 一个方向,再让它自行补全后续流程,不如要么提供足够完整的指导,让 AI 高效执行;要么减少路线限制,让系统自行探索并完成研究。


(来源:上述论文)

当然,ASI-Bench 的意义并不只是给不同模型排出名次,而是为不同类型的 AI 科研系统提供了一套更有针对性的能力检验方式。

对于新的基础模型或推理系统,ASI-Bench 尤其是 B3 这类“只给目标、不提供方法”的低指导条件,可以进一步检验模型是否真正具备更强的科学推理和自主研究能力。

对于 AI Scientist 或 AI for Science 系统,B1–B4 也可以作为一套诊断工具:B1 到 B2 降幅大,说明系统依赖完整操作流程;B2 到 B3 降幅大,则说明方法选择仍是短板;B3 与 B4 的差异,则反映系统面对干扰信息时的鲁棒性。

对于 Agent 或 Harness 开发者,同一底层模型搭配不同框架的表现差异,也能帮助判断性能提升究竟来自模型本身,还是任务规划、代码执行等系统设计。

目前 ASI-Bench 仍远未饱和,18 组配置在 B3 上平均只有 26.62 分,最高为 51.60。因此,未来任何在低指导条件下取得的稳定提升,都可以作为衡量 AI 自主科研能力进展的重要参照。

但真实科研远比这 60 个任务复杂,研究团队也因此把 ASI-Bench 设计成一个持续更新的开放基准,未来还会不断加入新的学科和任务。它更像是一把动态的尺子,用来观察随着人类指导逐渐减少,AI 能否越来越独立地完成方法选择、研究执行和结果验证。至于这是否意味着 AGI 或 ASI 正在到来,单一评测显然无法回答,但至少它把“AI 到底能不能自己做研究”这个过去较为模糊的问题,变成了一个可以持续比较的指标。

1.https://arxiv.org/abs/2608.17271

2.任务贡献:https://asibench.apexin.ai/submit

3.GitHub:https://github.com/apexin-ai/ASI-Bench

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
2米14,2米15,2米29,让美国男篮头疼的球队诞生了

2米14,2米15,2米29,让美国男篮头疼的球队诞生了

篮球大视野
2026-08-19 16:55:20
朱雀三号遥一回收失败原因披露

朱雀三号遥一回收失败原因披露

界面新闻
2026-08-19 10:33:02
75岁王石在深圳海滩跑步锻炼被偶遇!网友:他光着膀子,身材看起来好瘦,肌肉少得可怜,只剩皮包骨了

75岁王石在深圳海滩跑步锻炼被偶遇!网友:他光着膀子,身材看起来好瘦,肌肉少得可怜,只剩皮包骨了

火山詩话
2026-08-19 10:12:50
郭德纲曾经在《欢乐喜剧人》对沈腾说:“赐名沈云腾”沈腾没接话

郭德纲曾经在《欢乐喜剧人》对沈腾说:“赐名沈云腾”沈腾没接话

西楼知趣杂谈
2026-08-19 21:16:19
办升学宴5死17伤,村民:他们家是低保户,为庆祝孩子考上大学,喜事变丧事

办升学宴5死17伤,村民:他们家是低保户,为庆祝孩子考上大学,喜事变丧事

汉史趣闻
2026-08-19 14:39:00
杭州酒局最新细节:没一个人喝多,女生求助无果被推倒昏迷。更让人震惊的是清华毕业生的道德水准!

杭州酒局最新细节:没一个人喝多,女生求助无果被推倒昏迷。更让人震惊的是清华毕业生的道德水准!

听心堂
2026-08-19 07:22:25
或达17级!新台风生成!路径公布

或达17级!新台风生成!路径公布

在苍南
2026-08-19 15:58:00
到底发生了什么?网传底层的戾气越来越重了...

到底发生了什么?网传底层的戾气越来越重了...

慧翔百科
2026-08-19 12:11:15
继外籍男港铁上抱女子上演“活春宫”没人制止之后,又现一群赤膊外籍男子大闹港铁车厢无人敢言,内地时评质疑为何双重标准:这难道比内地游客随地坐更文明?

继外籍男港铁上抱女子上演“活春宫”没人制止之后,又现一群赤膊外籍男子大闹港铁车厢无人敢言,内地时评质疑为何双重标准:这难道比内地游客随地坐更文明?

澳门月刊
2026-08-18 16:41:18
“老师已经很委婉了!”女生学舞蹈被劝退,老师:长相还是很重要的!

“老师已经很委婉了!”女生学舞蹈被劝退,老师:长相还是很重要的!

林林先生
2026-08-19 10:37:03
单签盈利逼近50万元,中签女子含泪感谢宇树科技,并透露自己已在开盘后选择全部卖出,收益已经到手

单签盈利逼近50万元,中签女子含泪感谢宇树科技,并透露自己已在开盘后选择全部卖出,收益已经到手

鲁中晨报
2026-08-19 15:42:06
事态升级!郁廷栋也被抓了,赵海峰给地产的锅掀了,两大集团出手

事态升级!郁廷栋也被抓了,赵海峰给地产的锅掀了,两大集团出手

社会日日鲜
2026-08-19 09:10:23
实名举报反转?哥哥唐时达法庭亮微信记录,指控弟弟唐一达冒名案中涉嫌行贿

实名举报反转?哥哥唐时达法庭亮微信记录,指控弟弟唐一达冒名案中涉嫌行贿

网易新闻出品
2026-08-18 19:01:05
马斯克直呼完了:Anthropic 73页论文刷屏,全球大模型中招思想病毒!

马斯克直呼完了:Anthropic 73页论文刷屏,全球大模型中招思想病毒!

新智元
2026-08-19 20:52:37
特种部队俘获30名俄军!俄媒大肆报道,暗示乌军第3军团司令已死

特种部队俘获30名俄军!俄媒大肆报道,暗示乌军第3军团司令已死

鹰眼Defence
2026-08-19 17:41:00
25岁研究生管培生硬刚权力酒局:不收100万私了,她救了无数职场女性

25岁研究生管培生硬刚权力酒局:不收100万私了,她救了无数职场女性

十为先生
2026-08-19 16:22:16
中一签赚超47万元!男子上个月刚中了长鑫、这个月又中了宇树,“没有打新技巧,觉得99%靠运气”

中一签赚超47万元!男子上个月刚中了长鑫、这个月又中了宇树,“没有打新技巧,觉得99%靠运气”

极目新闻
2026-08-19 15:45:34
首款车型预售当晚App崩溃无法下单 高管自嘲“草台班子”

首款车型预售当晚App崩溃无法下单 高管自嘲“草台班子”

凤凰网科技
2026-08-19 12:53:12
越来越多的人呼吁取消退休工资,以缓解养老压力,但真的可行吗?

越来越多的人呼吁取消退休工资,以缓解养老压力,但真的可行吗?

离离言几许
2026-08-19 16:32:37
四川长宁升学宴墙壁倒塌致5死17伤,主家亲属:主家发愁怎么赔偿,希望大家嘴下留情

四川长宁升学宴墙壁倒塌致5死17伤,主家亲属:主家发愁怎么赔偿,希望大家嘴下留情

潇湘晨报
2026-08-19 23:18:08
2026-08-20 03:47:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4482154文章数 9324关注度
往期回顾 全部

科技要闻

宇树的悬念还在后面

头条要闻

升学宴事故致5死17伤 主家亲属:主家发愁怎么赔偿

头条要闻

升学宴事故致5死17伤 主家亲属:主家发愁怎么赔偿

体育要闻

拥有“儿皇梦”的罗德里,为何选择巴萨?

娱乐要闻

章子怡财路遭到质疑,套现3亿冲上热搜

财经要闻

内部反腐,让大疆错过宇树250亿收益?

汽车要闻

小米澎程N70体验 后排空间夸张亦可旋转对坐

态度原创

亲子
家居
房产
本地
游戏

亲子要闻

工程车小故事:妹妹逃避吃药受伤 #儿童益智类手工玩具

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

涉及3800亩!海口秀英港又有大动作!

本地新闻

先导片|攀登不止,让不同的故事在此连接

曝索尼1599元精英手柄将出新款:神秘型号现身

无障碍浏览 进入关怀版