网易首页 > 网易号 > 正文 申请入驻

AI能否独立开展科研?ASI-Bench为科学自主性建立评测标尺

0
分享至

来源:市场资讯

(来源:机器之心)

如果超级智能有黎明,
我们现在大概在黎明破晓前。
天还没亮,但地平线上已经有光了。


ASI-Bench 想做的是在天亮之前,造一把能测量「AI 距离人类智能上限还有多远」的尺子 —— 量一量 AI 到底走到了哪里。

ASI-Bench 是由清华大学人工智能学院助理教授陈勇超联合全球科学家团队,携手麻省理工学院、哈佛大学、卡内基梅隆大学、中国科学技术大学、微软研究院等十余所机构开发的 —— 一个专为衡量 AI 系统科学自主性而设计的基准测试。


  • 论文地址:https://arxiv.org/abs/2608.17271

  • 贡献入口:https://asibench.apexin.ai/submit

  • GitHub:https://github.com/apexin-ai/ASI-Bench

目前 ASI-Bench 已向更多研究者开放贡献:https://asibench.apexin.ai/submit


为什么 ASI 重要

AI 过去几年的强大,主要建立在一件事上:学习人类已经知道的东西,然后更快更准地调用。模型可以在越来越多的考试和 benchmark 上拿高分,但这些高分大多说明同一件事 —— 它理解、调用和重组已有知识的能力很强。

但知识的边界不是这样推开的 —— 不是靠更熟练地调用已知来推开的。

研究本质上都是排列组合。真正具有变革意义的发现,往往不只是对已有知识更高明的重组,而是在概率密度极低的未知地带,找到此前从未被探索过的组合—— 在那些还没被观测、没被概念化、甚至还没被意识到是问题的地带。

面对这些地带,AI 需要自己判断:这个问题该怎么研究?用什么方法?观察哪些现象?如果第一步走错了,能不能自己发现并换一条路?

这不只是推理能力,是创新性和执行力的结合。AI 从掌握已知走向探索未知这一步,就是 ASI 之所以重要的原因。

科学研究是观察这种能力最自然的场景。科研本身就是在不确定条件下探索未知 —— 提出问题、选择方法、执行实验、理解结果、修正方向。它天然同时需要知识、判断和执行。如果 AI 能独立推进一个研究课题,它才开始接近自主智能。

但问题来了:如果无法评测,就没法判断 AI 到底走到了哪一步。

ASI-Bench 是什么

ASI(Artificial Superintelligence)在这个语境下不是科幻概念,而是一个具体定义:AI 从掌握和执行人类已有知识,走向自主探索未知、创造新知识并将其真正执行出来。它需要三样东西同时具备。

通用智能

ASI 不能只在数学、代码或某一个垂直领域里强。它应该能面对不同领域的问题,理解新的科学目标,把研究能力迁移过去。

创新性

ASI 不只是调用已有方法。它需要自己在缺少现成路径时提出假设、选择技术路线、判断什么信息重要,并根据新出现的现象调整方向。创新性最关键的测试条件是:人类不再把完整方法告诉它,只告诉它一个需要研究的方向。

自主执行力

有想法不等于能完成研究。模型还需要把想法变成具体步骤 —— 调用工具、写代码、跑实验、排查错误,最终交付可以检查的结果。

三者缺一不可。只有通用智能没有创新性,模型只是个覆盖面广的知识库。只有创新想法没有执行力,模型提了一堆方向但没法验证。只有执行力没有创新性,模型按人给的方法做得很好,但自己开不了新路。

现在的基准为什么不够用?

现有 benchmark 分别把这三个能力推得很远,但各自只测了一个切面。


Humanity's Last Exam 有 2500 道题覆盖 100 多个学科,前沿模型得分很低,充分体现了知识难度 —— 但它以封闭式问答为主,不要求模型处理数据或选择研究方法。

Terminal-Bench 2.0 的 89 个终端任务前沿系统完成率低于 65%,Agents' Last Exam 最难一级的通过率不到 1%—— 它们测了长程执行,但任务目标和验证标准已经给定,重点是把活干完,不是决定该干什么。

没有一个 benchmark 同时测通用智能、创新性和执行力。也没有一个 benchmark 在同一个科研项目里系统地逐步撤去人类的方法指导,看 AI 自己还能走多远。

ASI-Bench 做的就是这件事。

ASI-Bench 怎么工作

ASI-Bench 的机制不复杂,但逻辑很直接:同一个科研项目,同一个输入数据,同一个评分标准,只改变提供给模型的方法论信息量。

设计核心是信息梯度。


同一个科研项目,喂给 AI 四次,每次给的指导量不同:

  • B1 给完整方法和实现步骤,测的是执行力 —— 你能不能照着做。

  • B2 只给方法名称,不给细节,测的是能不能把方法名变成可执行的流程。

  • B3 什么都不给,只有科研目标、原始数据和约束条件,AI 得自己选方法、搭流程、跑实验、判结果 —— 这是创新性的核心测试。

  • B4 在 B3 基础上加一些正确但无关的干扰信息,看 AI 会不会跑偏。

B1 到 B3 的差距,就是模型对人类方法指导的依赖程度。它直接回答一个问题:人类一步步放手,模型到底还能走多远?

60 道题覆盖 11 个领域 —— 数学、物理、化学、生物、天文、材料、地球科学、医学 / 生物统计、计算机、机器人、电子工程 —— 不同领域的知识结构、数据形式和方法选择完全不同,同一个系统必须在全部领域接受评测,没法只靠某个垂直能力吃分。

结果是什么?

在 60 个 project-level 科研任务上,团队测试了 Codex、Apex Research、Claude Code、Kimi Code、MiMo Code 和 OpenHands 6 种 agent harness,搭配 GPT-5.5、GPT-5.6 Sol、Claude Opus、Kimi、DeepSeek、GLM、MiniMax、MiMo 等不同 backbone model,共形成 18 组 Harness× Model 组合。


当模型在 B1 条件下获得完整方法指导时,18 组配置的平均 Scientific Score 为 50.92 分;当指导逐步减少,到 B3 中不再提供具体方法时,平均分下降到 27.17 分,相比 B1 下降 23.75 分,接近一半。

这种下降并不只发生在较弱的模型上。

表现最好的组合 Codex + GPT-5.6 Sol (ultra),在 B1 中得到 71.78 分,在 B3 中也下降到 51.60 分;这已经是全部 18 组配置中 B3 的最高成绩。另一个例子是 Claude Code + Claude Opus 5:B1 得分达到全表最高的 72.29 分,但在减少方法信息后,B3 只有 40.70 分。

最大的性能损失发生在第一次撤掉详细方法指导时:从「提供完整方法」的 B1 到「只提供方法名称」的 B2,所有配置平均下降 21.28 分。之后从 B2 到 B3,平均分只进一步下降约 2.47 分。

这意味着,真正决定模型能否完成这些科研任务的,并不只是有没有一个方法名称,而是当详细的方法路径不再由人类提供后,模型能否自己完成科学建模、方法选择和研究路径设计。

进一步的失败分析也呈现出相同趋势:62% 的失败集中在科学决策环节,包括科学建模、方法选择和鲁棒性判断;只有约 26% 属于纯数值执行问题。换句话说,当前 AI 在这些任务上的主要瓶颈,并不是 “算不对”,而是在人类指导退出之后,不知道应该算什么、为什么这样算,以及下一步应该怎么做。

分数低不是 benchmark 的缺点。恰恰相反,它说明这把尺子还有足够大的区分空间。

凭什么相信这些数字

高难度但不可靠的 benchmark 没有意义。题目本身、参考结果和评分方法都可信,分数才有意义。

ASI-Bench 的每个任务都经过四个阶段构建:有来源依据的科研问题收集、领域专家筛选与任务工程化、AI 辅助审计加四轮人工审查、沙箱端到端执行验证。

四眼原则、双人复核制(Four Eyes Principle/Four-Eyes Check)

第一轮,每个任务至少分配给两名非作者 reviewer 独立审查。第二轮重新分配 reviewer,检查上一轮的修改是否落实。第三轮重点做 B1-B4 的 agent trajectory 分析。第四轮优先由同领域 reviewer 检查,再加一轮 Claude Code scan。

AI 审计不只查文字。它检查科学逻辑、prompt 层级、参考文件、评分代码、信息泄漏和 agent 轨迹,重点识别目标与 scorer 不一致、隐藏信息泄漏、硬编码答案和非预期捷径。

每个任务还要通过沙箱端到端执行:环境检查、reference solution 自评、受限工具运行、matched instances 和 controlled random seeds。reviewer 继续查结果文件、日志和中间轨迹,发现 runtime failure 或评分不一致就返修。

做对科学问题,才能拿高分

Richards-Topmodel 水文模型任务,最能说明团队的工作方式。

任务构建过程中,团队发现 generic baseline 拿到了过高分数,评分 rubric 没有抓住核心科学机制,模型不需要真正理解水文过程就能得分。这是不能接受的。

于是团队重新调整了权重、单位和边界条件:调整后,generic baseline 降到 11.3-17.0,正确方法拿到 89.5-100,reference 拿到 100。分数分布回到了它应有的样子。

一个 task 的构建,不只是写 prompt。反复检查科学机制、评分逻辑和真实模型行为,直到做对科学问题与拿到高分真正一致,这是团队对每一个任务的标准。


ASI-Bench 适合谁

模型团队:

如果你做了一个新的基础模型或推理模型,除了想在已有 benchmark 上把分数提高几个百分点,还想证明自己真的更聪明 —— 来跑 ASI-Bench。尤其是在 B3 低信息条件下涨分,比在 B1 涨分更能说明智能层面的进步。

AI Scientist/AI for Science 方向的开发者:

如果你做了一个 AI Scientist 系统或研究 agent,想知道它离开完整人类指导后还能不能把研究做下去,来跑 ASI-Bench。四层梯度能告诉你问题出在哪:B1 到 B2 掉得多,说明知道方法名但实现不出来;B2 到 B3 掉得多,说明能实现给定方法但不会自己选方法。

Agent 框架开发者:

如果你想比较不同模型或不同 agent 架构 —— 同一个模型搭不同 harness,或者不同模型搭同一个 framework,ASI-Bench 的项目级任务比短任务更有区分度。

现在分数还很低,benchmark 远未饱和。任何显著提升,都是系统在更高阶智能能力上真正进步的证明。如果你认为自己的模型真的更聪明了 —— 来 ASI-Bench 上证明它。


来自社区,也需要社区:你将定义 ASI 的未来

ASI-Bench 的第一版 60 道题,来自多个学科领域研究者的贡献 —— 清华大学、MIT、CMU、中科大、波士顿大学、伊利诺伊大学香槟分校、昆士兰大学、Flatiron Institute、Microsoft Research 等机构的研究者参与了任务构建和审查。

衡量 Superintelligence 的标准,不可能由一个团队单独定义。


团队希望更多研究者贡献自己领域真正有价值、足够困难的任务。你可以通过以下方式参与:

  • 提交课题想法:你所在领域里真正困难、有研究价值、适合检验 AI 能力的问题

  • 构建完整任务:数据、环境、输入输出、参考结果和运行方式

  • 设计评分 Rubrics:什么样的结果算完成,关键步骤是什么,怎么计分

  • 审查与反馈:发现已有任务的问题,提出修正建议

  • 提交运行结果:用自己的模型和 Agent 跑分,提交可验证的结果

当未来的 ASI 系统真正具备独立开展科学研究的能力时,评估这种能力的标准将由我们今天共同定义。让下一代 AI 面对的不只是人类已经写下答案的问题,而是人类真正希望它帮助解决的问题。

ASI-Bench 是通往超越人类智能上限之路上的第一把刻度清晰的尺子。

天还没亮,但我们已经可以开始量了。它已经告诉我们一个初步的结论:当前 AI 离真正的自主科研还有明显的距离 —— 能执行不等于能独立,能完成指定任务不等于能自主决定研究路径。这个距离,正是接下来需要一步步缩短的。

欢迎更多团队、研究者和模型来 ASI-Bench 上跑分、提交任务、一起完善这把尺子。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
2人吞6000万!韩红基金会急发声,1800万差价说不清,官方已下场

2人吞6000万!韩红基金会急发声,1800万差价说不清,官方已下场

大鱼简科
2026-08-26 11:57:30
“和稀泥”换不来稳定

“和稀泥”换不来稳定

第一财经资讯
2026-08-26 15:05:02
弗朗西斯:在中国每天都能看见活着的牲畜,实在难以适应

弗朗西斯:在中国每天都能看见活着的牲畜,实在难以适应

懂球帝
2026-08-26 11:44:13
刘翔发文向网友征求意见:上海市体育局让我买断或当教练上班,我该怎么办

刘翔发文向网友征求意见:上海市体育局让我买断或当教练上班,我该怎么办

鲁中晨报
2026-08-26 18:58:04
最新 | 太突然!两巨头宣布:大幅涨价!

最新 | 太突然!两巨头宣布:大幅涨价!

天津广播
2026-08-26 09:13:13
25岁赴韩中国女留学生已确认遇害,熟人作案,凶手身份曝光难以置信

25岁赴韩中国女留学生已确认遇害,熟人作案,凶手身份曝光难以置信

小徐讲八卦
2026-08-26 10:33:47
56岁张延和港星张锦程离婚,结束逾20年婚姻,男方发声证实

56岁张延和港星张锦程离婚,结束逾20年婚姻,男方发声证实

开开森森
2026-08-26 14:38:10
2-0!郑钦文紧握拳头:资格赛5连胜 奖金44万元 再赢1场进美网正赛

2-0!郑钦文紧握拳头:资格赛5连胜 奖金44万元 再赢1场进美网正赛

风过乡
2026-08-27 06:23:34
750万电驴吞噬城市:深圳败笔不是乱停,是人行道变成夺命赛道!

750万电驴吞噬城市:深圳败笔不是乱停,是人行道变成夺命赛道!

健身狂人
2026-08-27 02:50:55
黑人博主炫耀和400多个中国女生约会,全部都发到油管上,账号名叫“黑人在中国”

黑人博主炫耀和400多个中国女生约会,全部都发到油管上,账号名叫“黑人在中国”

汉史趣闻
2026-08-26 08:32:56
为什么“产能过剩”被视为一种灾难?

为什么“产能过剩”被视为一种灾难?

罗sir财话
2026-08-25 11:42:11
撕破脸!刘翔回怼上海体育局:依的哪条规?十年了才想起来安置我

撕破脸!刘翔回怼上海体育局:依的哪条规?十年了才想起来安置我

我爱英超
2026-08-26 22:49:45
刘翔海外“躺平”真相:凭终身合同年入千万,躲开谩骂,活成“人间清醒”

刘翔海外“躺平”真相:凭终身合同年入千万,躲开谩骂,活成“人间清醒”

黎兜兜
2026-08-14 18:01:55
视频丨中国救援队111名消防救援指战员赴西藏吉隆灾害现场增援

视频丨中国救援队111名消防救援指战员赴西藏吉隆灾害现场增援

国际在线
2026-08-27 05:58:11
叙利亚退了,巴勒斯坦退了,黎巴嫩退了,委内瑞拉退了,他们退了,换得了什么?俄罗斯不退,朝鲜不退,中国不退,他们知道退了意味着什么

叙利亚退了,巴勒斯坦退了,黎巴嫩退了,委内瑞拉退了,他们退了,换得了什么?俄罗斯不退,朝鲜不退,中国不退,他们知道退了意味着什么

扶苏聊历史
2026-08-26 13:53:10
又来侮辱公众智商了!

又来侮辱公众智商了!

清书先生
2026-08-26 17:39:04
尼泊尔8:10山洪,10:30砸进吉隆口岸:不是"没预警",是预警的雨量计只装到海关这一侧

尼泊尔8:10山洪,10:30砸进吉隆口岸:不是"没预警",是预警的雨量计只装到海关这一侧

防灾小卫士
2026-08-26 18:05:15
“第一个被姑姑退回来的孩子!”一段视频,戳破亲戚间体面的遮羞布!

“第一个被姑姑退回来的孩子!”一段视频,戳破亲戚间体面的遮羞布!

林林先生
2026-08-26 09:25:09
心酸!54岁港星女神商场走穴,当年比肩李嘉欣,现成了十八线网红

心酸!54岁港星女神商场走穴,当年比肩李嘉欣,现成了十八线网红

寒士之言本尊
2026-08-24 16:22:31
尼泊尔一侧发生泥石流灾害,致西藏吉隆口岸重大人员伤亡、失联,有建筑被掩埋,武警官兵已前往现场处置

尼泊尔一侧发生泥石流灾害,致西藏吉隆口岸重大人员伤亡、失联,有建筑被掩埋,武警官兵已前往现场处置

极目新闻
2026-08-26 16:40:04
2026-08-27 07:52:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4560719文章数 9361关注度
往期回顾 全部

科技要闻

苹果邀请函:新CEO、折叠屏iPhone都要来了

头条要闻

媒体:"谁在持续攻击在菲中资钢铁厂"答案越来越清晰了

头条要闻

媒体:"谁在持续攻击在菲中资钢铁厂"答案越来越清晰了

体育要闻

兑现五年之约,含梗量最高的世界冠军诞生

娱乐要闻

包文婧当初担心包贝尔出轨,预言成真

财经要闻

洪灏:人民币是全球最被低估的货币

汽车要闻

搭华为ADS 5/增程纯电可选 阿尔法T7预售13.78万起

态度原创

教育
家居
数码
手机
公开课

教育要闻

大学建家长群,你支持吗?你怎么看待大学建家长群这件事呢?

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

树莓派发布官方教程:教你打造一台专属赛博甲板电脑

手机要闻

苹果秋季发布会,定档9月10日凌晨

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版