网易首页 > 网易号 > 正文 申请入驻

AI能否独立开展科研?ASI-Bench为科学自主性建立评测标尺

0
分享至



如果超级智能有黎明,
我们现在大概在黎明破晓前。
天还没亮,但地平线上已经有光了。



ASI-Bench 想做的是在天亮之前,造一把能测量「AI 距离人类智能上限还有多远」的尺子 —— 量一量 AI 到底走到了哪里。

ASI-Bench 是由清华大学人工智能学院助理教授陈勇超联合全球科学家团队,携手麻省理工学院、哈佛大学、卡内基梅隆大学、中国科学技术大学、微软研究院等十余所机构开发的 —— 一个专为衡量 AI 系统科学自主性而设计的基准测试。



  • 论文地址:https://arxiv.org/abs/2608.17271
  • 贡献入口:https://asibench.apexin.ai/submit
  • GitHub:https://github.com/apexin-ai/ASI-Bench

目前 ASI-Bench 已向更多研究者开放贡献:https://asibench.apexin.ai/submit



为什么 ASI 重要

AI 过去几年的强大,主要建立在一件事上:学习人类已经知道的东西,然后更快更准地调用。模型可以在越来越多的考试和 benchmark 上拿高分,但这些高分大多说明同一件事 —— 它理解、调用和重组已有知识的能力很强。

但知识的边界不是这样推开的 —— 不是靠更熟练地调用已知来推开的。

研究本质上都是排列组合。真正具有变革意义的发现,往往不只是对已有知识更高明的重组,而是在概率密度极低的未知地带,找到此前从未被探索过的组合—— 在那些还没被观测、没被概念化、甚至还没被意识到是问题的地带。

面对这些地带,AI 需要自己判断:这个问题该怎么研究?用什么方法?观察哪些现象?如果第一步走错了,能不能自己发现并换一条路?

这不只是推理能力,是创新性和执行力的结合。AI 从掌握已知走向探索未知这一步,就是 ASI 之所以重要的原因。

科学研究是观察这种能力最自然的场景。科研本身就是在不确定条件下探索未知 —— 提出问题、选择方法、执行实验、理解结果、修正方向。它天然同时需要知识、判断和执行。如果 AI 能独立推进一个研究课题,它才开始接近自主智能。

但问题来了:如果无法评测,就没法判断 AI 到底走到了哪一步。

ASI-Bench 是什么

ASI(Artificial Superintelligence)在这个语境下不是科幻概念,而是一个具体定义:AI 从掌握和执行人类已有知识,走向自主探索未知、创造新知识并将其真正执行出来。它需要三样东西同时具备。

通用智能

ASI 不能只在数学、代码或某一个垂直领域里强。它应该能面对不同领域的问题,理解新的科学目标,把研究能力迁移过去。

创新性

ASI 不只是调用已有方法。它需要自己在缺少现成路径时提出假设、选择技术路线、判断什么信息重要,并根据新出现的现象调整方向。创新性最关键的测试条件是:人类不再把完整方法告诉它,只告诉它一个需要研究的方向。

自主执行力

有想法不等于能完成研究。模型还需要把想法变成具体步骤 —— 调用工具、写代码、跑实验、排查错误,最终交付可以检查的结果。

三者缺一不可。只有通用智能没有创新性,模型只是个覆盖面广的知识库。只有创新想法没有执行力,模型提了一堆方向但没法验证。只有执行力没有创新性,模型按人给的方法做得很好,但自己开不了新路。

现在的基准为什么不够用?

现有 benchmark 分别把这三个能力推得很远,但各自只测了一个切面。



Humanity's Last Exam 有 2500 道题覆盖 100 多个学科,前沿模型得分很低,充分体现了知识难度 —— 但它以封闭式问答为主,不要求模型处理数据或选择研究方法。

Terminal-Bench 2.0 的 89 个终端任务前沿系统完成率低于 65%,Agents' Last Exam 最难一级的通过率不到 1%—— 它们测了长程执行,但任务目标和验证标准已经给定,重点是把活干完,不是决定该干什么。

没有一个 benchmark 同时测通用智能、创新性和执行力。也没有一个 benchmark 在同一个科研项目里系统地逐步撤去人类的方法指导,看 AI 自己还能走多远。

ASI-Bench做的就是这件事。

ASI-Bench 怎么工作

ASI-Bench 的机制不复杂,但逻辑很直接:同一个科研项目,同一个输入数据,同一个评分标准,只改变提供给模型的方法论信息量。

设计核心是信息梯度。



同一个科研项目,喂给 AI 四次,每次给的指导量不同:

  • B1 给完整方法和实现步骤,测的是执行力 —— 你能不能照着做。
  • B2 只给方法名称,不给细节,测的是能不能把方法名变成可执行的流程。
  • B3 什么都不给,只有科研目标、原始数据和约束条件,AI 得自己选方法、搭流程、跑实验、判结果 —— 这是创新性的核心测试。
  • B4 在 B3 基础上加一些正确但无关的干扰信息,看 AI 会不会跑偏。

B1 到 B3 的差距,就是模型对人类方法指导的依赖程度。它直接回答一个问题:人类一步步放手,模型到底还能走多远?

60 道题覆盖 11 个领域 —— 数学、物理、化学、生物、天文、材料、地球科学、医学 / 生物统计、计算机、机器人、电子工程 —— 不同领域的知识结构、数据形式和方法选择完全不同,同一个系统必须在全部领域接受评测,没法只靠某个垂直能力吃分。

结果是什么?

在 60 个 project-level 科研任务上,团队测试了 Codex、Apex Research、Claude Code、Kimi Code、MiMo Code 和 OpenHands 6 种 agent harness,搭配 GPT-5.5、GPT-5.6 Sol、Claude Opus、Kimi、DeepSeek、GLM、MiniMax、MiMo 等不同 backbone model,共形成 18 组 Harness× Model 组合。



当模型在 B1 条件下获得完整方法指导时,18 组配置的平均 Scientific Score 为 50.92 分;当指导逐步减少,到 B3 中不再提供具体方法时,平均分下降到 27.17 分,相比 B1 下降 23.75 分,接近一半。

这种下降并不只发生在较弱的模型上。

表现最好的组合 Codex + GPT-5.6 Sol (ultra),在 B1 中得到 71.78 分,在 B3 中也下降到 51.60 分;这已经是全部 18 组配置中 B3 的最高成绩。另一个例子是 Claude Code + Claude Opus 5:B1 得分达到全表最高的 72.29 分,但在减少方法信息后,B3 只有 40.70 分。

最大的性能损失发生在第一次撤掉详细方法指导时:从「提供完整方法」的 B1 到「只提供方法名称」的 B2,所有配置平均下降 21.28 分。之后从 B2 到 B3,平均分只进一步下降约 2.47 分。

这意味着,真正决定模型能否完成这些科研任务的,并不只是有没有一个方法名称,而是当详细的方法路径不再由人类提供后,模型能否自己完成科学建模、方法选择和研究路径设计。

进一步的失败分析也呈现出相同趋势:62% 的失败集中在科学决策环节,包括科学建模、方法选择和鲁棒性判断;只有约 26% 属于纯数值执行问题。换句话说,当前 AI 在这些任务上的主要瓶颈,并不是 “算不对”,而是在人类指导退出之后,不知道应该算什么、为什么这样算,以及下一步应该怎么做。

分数低不是 benchmark 的缺点。恰恰相反,它说明这把尺子还有足够大的区分空间。

凭什么相信这些数字

高难度但不可靠的 benchmark 没有意义。题目本身、参考结果和评分方法都可信,分数才有意义。

ASI-Bench的每个任务都经过四个阶段构建:有来源依据的科研问题收集、领域专家筛选与任务工程化、AI 辅助审计加四轮人工审查、沙箱端到端执行验证。

四眼原则、双人复核制(Four Eyes Principle/Four-Eyes Check)

第一轮,每个任务至少分配给两名非作者 reviewer 独立审查。第二轮重新分配 reviewer,检查上一轮的修改是否落实。第三轮重点做 B1-B4 的 agent trajectory 分析。第四轮优先由同领域 reviewer 检查,再加一轮 Claude Code scan。

AI 审计不只查文字。它检查科学逻辑、prompt 层级、参考文件、评分代码、信息泄漏和 agent 轨迹,重点识别目标与 scorer 不一致、隐藏信息泄漏、硬编码答案和非预期捷径。

每个任务还要通过沙箱端到端执行:环境检查、reference solution 自评、受限工具运行、matched instances 和 controlled random seeds。reviewer 继续查结果文件、日志和中间轨迹,发现 runtime failure 或评分不一致就返修。

做对科学问题,才能拿高分

Richards-Topmodel 水文模型任务,最能说明团队的工作方式。

任务构建过程中,团队发现 generic baseline 拿到了过高分数,评分 rubric 没有抓住核心科学机制,模型不需要真正理解水文过程就能得分。这是不能接受的。

于是团队重新调整了权重、单位和边界条件:调整后,generic baseline 降到 11.3-17.0,正确方法拿到 89.5-100,reference 拿到 100。分数分布回到了它应有的样子。

一个 task 的构建,不只是写 prompt。反复检查科学机制、评分逻辑和真实模型行为,直到做对科学问题与拿到高分真正一致,这是团队对每一个任务的标准。



ASI-Bench 适合谁

模型团队:

如果你做了一个新的基础模型或推理模型,除了想在已有 benchmark 上把分数提高几个百分点,还想证明自己真的更聪明 —— 来跑 ASI-Bench。尤其是在 B3 低信息条件下涨分,比在 B1 涨分更能说明智能层面的进步。

AI Scientist/AI for Science 方向的开发者:

如果你做了一个 AI Scientist 系统或研究 agent,想知道它离开完整人类指导后还能不能把研究做下去,来跑ASI-Bench。四层梯度能告诉你问题出在哪:B1 到 B2 掉得多,说明知道方法名但实现不出来;B2 到 B3 掉得多,说明能实现给定方法但不会自己选方法。

Agent 框架开发者:

如果你想比较不同模型或不同 agent 架构 —— 同一个模型搭不同 harness,或者不同模型搭同一个 framework,ASI-Bench的项目级任务比短任务更有区分度。

现在分数还很低,benchmark 远未饱和。任何显著提升,都是系统在更高阶智能能力上真正进步的证明。如果你认为自己的模型真的更聪明了 —— 来ASI-Bench上证明它。



来自社区,也需要社区:你将定义 ASI 的未来

ASI-Bench 的第一版 60 道题,来自多个学科领域研究者的贡献—— 清华大学、MIT、CMU、中科大、波士顿大学、伊利诺伊大学香槟分校、昆士兰大学、Flatiron Institute、Microsoft Research 等机构的研究者参与了任务构建和审查。

衡量 Superintelligence 的标准,不可能由一个团队单独定义。



团队希望更多研究者贡献自己领域真正有价值、足够困难的任务。你可以通过以下方式参与:

  • 提交课题想法:你所在领域里真正困难、有研究价值、适合检验 AI 能力的问题
  • 构建完整任务:数据、环境、输入输出、参考结果和运行方式
  • 设计评分 Rubrics:什么样的结果算完成,关键步骤是什么,怎么计分
  • 审查与反馈:发现已有任务的问题,提出修正建议
  • 提交运行结果:用自己的模型和 Agent 跑分,提交可验证的结果

当未来的 ASI 系统真正具备独立开展科学研究的能力时,评估这种能力的标准将由我们今天共同定义。让下一代 AI 面对的不只是人类已经写下答案的问题,而是人类真正希望它帮助解决的问题。

ASI-Bench 是通往超越人类智能上限之路上的第一把刻度清晰的尺子。

天还没亮,但我们已经可以开始量了。它已经告诉我们一个初步的结论:当前 AI 离真正的自主科研还有明显的距离 —— 能执行不等于能独立,能完成指定任务不等于能自主决定研究路径。这个距离,正是接下来需要一步步缩短的。

欢迎更多团队、研究者和模型来ASI-Bench上跑分、提交任务、一起完善这把尺子。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

北海史记
2026-08-12 19:57:54
6架中国空军歼-16重型战斗机降落在埃及,最慌的会是谁?

6架中国空军歼-16重型战斗机降落在埃及,最慌的会是谁?

浯江孤舟
2026-08-24 10:13:32
折腾半生倾家荡产,77岁牛群近况曝光,被美国毕业的儿子这样对待

折腾半生倾家荡产,77岁牛群近况曝光,被美国毕业的儿子这样对待

北海史记
2026-08-21 01:10:18
向余望继续搞下去,绝对废了

向余望继续搞下去,绝对废了

中场阴谋家
2026-08-25 21:04:36
顶级牛散大调仓!章建平又入1股,重仓算力清退资源!葛卫东加仓芯片

顶级牛散大调仓!章建平又入1股,重仓算力清退资源!葛卫东加仓芯片

证券时报
2026-08-26 10:46:04
《大决战》上映后,李作鹏批评:很假,若罗荣桓在世,此片通不过

《大决战》上映后,李作鹏批评:很假,若罗荣桓在世,此片通不过

帝哥说史
2026-08-14 23:17:49
5-2!赵心童、塞尔比携手晋级,武汉赛16强出炉,诞生3大夺冠热门

5-2!赵心童、塞尔比携手晋级,武汉赛16强出炉,诞生3大夺冠热门

球场没跑道
2026-08-25 22:31:15
许家印最惨追随者

许家印最惨追随者

地产微资讯
2026-08-25 19:13:37
姜珮瑶本硕毕业同班32个同学16个靠综艺赚够首付她头6年没上热搜

姜珮瑶本硕毕业同班32个同学16个靠综艺赚够首付她头6年没上热搜

阿废冷眼观察所
2026-08-26 09:33:54
天津这里已达大暴雨级别

天津这里已达大暴雨级别

天津人
2026-08-26 10:32:14
紧急叫停!这五类人禁用甲钻胺!医生警告:出现4个症状必须停药

紧急叫停!这五类人禁用甲钻胺!医生警告:出现4个症状必须停药

读懂世界历史
2026-08-25 16:57:40
特斯拉回应上海数据中心“人去楼空”:不实消息

特斯拉回应上海数据中心“人去楼空”:不实消息

金融界
2026-08-26 12:47:45
最新排名出炉!日本第一,泰国第三,中国女排挑对手

最新排名出炉!日本第一,泰国第三,中国女排挑对手

跑者排球视角
2026-08-25 23:47:11
低端家庭,个个是犟种。

低端家庭,个个是犟种。

老陆不老
2026-08-13 08:31:06
一个贪财一个好色?许家印事出5天,不止丁玉梅被曝30岁白人男友

一个贪财一个好色?许家印事出5天,不止丁玉梅被曝30岁白人男友

墨印斋
2026-08-25 12:38:26
马斯克:不要担心别人会超过你——因为多数人,连"坚持"这一关都过不了

马斯克:不要担心别人会超过你——因为多数人,连"坚持"这一关都过不了

杏花烟雨江南的碧园
2026-08-14 16:15:03
427万辆车召回警示:造车十余年,连个门把手都造不好?

427万辆车召回警示:造车十余年,连个门把手都造不好?

虎嗅APP
2026-08-26 02:02:08
天后女儿男女通吃!张杰造型团队大换血!

天后女儿男女通吃!张杰造型团队大换血!

八卦疯叔
2026-08-26 10:30:07
韩沛颖认怂!称其只是表达不清,被人误解,已向刘浩存王晓晨道歉

韩沛颖认怂!称其只是表达不清,被人误解,已向刘浩存王晓晨道歉

寒士之言本尊
2026-08-24 16:22:49
国台办:统一大势不可阻挡,“以武谋独”加速灭亡

国台办:统一大势不可阻挡,“以武谋独”加速灭亡

新京报
2026-08-26 10:22:36
2026-08-26 13:48:51
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13847文章数 142726关注度
往期回顾 全部

科技要闻

OpenAI首颗芯片炸场:第一代就杀进前沿

头条要闻

美国士兵试图进入在菲律宾中资钢铁厂 中国使馆反问

头条要闻

美国士兵试图进入在菲律宾中资钢铁厂 中国使馆反问

体育要闻

B费当选PFA最佳球员 曼联近16年首人

娱乐要闻

韩沛颖风波发酵,大学同学揭开细节

财经要闻

宗馥莉汽水铺销售遇冷

汽车要闻

220万台交付 GL8陆尊/至境世家发布限时焕新置换价

态度原创

艺术
健康
教育
手机
公开课

艺术要闻

丁一林 油画风景写生新作(2026年5~7月)

女孩几岁月经?7个青春期月经真相

教育要闻

2027高考政策有3个重要变化!

手机要闻

三星Galaxy S26 FE手机壳渲染图曝光:3款3种颜色

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版