网易首页 > 网易号 > 正文 申请入驻

代码榜刷满分,AI科研却撞墙?140道真实研究题撕开「自进化」真相

0
分享至


新智元报道


AI已经能写代码、跑实验,甚至靠海量试错刷新部分人类纪录。

但当目标从「把一个分数继续刷高」,变成「提出一种真正更好的机器学习方法」,最强模型还能走多远?

一项覆盖12个领域、140个真实研究任务的新工作MLS-Bench给出了并不乐观的答案。

即使拿到人类最强方法的完整实现,并被允许反复实验,当前前沿模型仍没有展示出可靠的方法创新能力。它们交出的所谓新方案,基本仍是对已知方法的调优与重新组合。

更值得注意的是,MLS-Bench的评测已经进入Kimi K3和Qwen3.8-Max的官方发版表。

代码评测逐渐饱和后,头部模型厂商正在把下一个能力前沿指向同一个问题:

AI能否真正开展研究?


论文链接:https://arxiv.org/abs/2605.08678

项目主页:https://mls-bench.com/

代码链接:https://github.com/Imbernoulli/MLS-Bench

在Kimi K3与Qwen3.8-Max的官方评测表中,MLS-Bench-Lite与软件工程、终端操作和通用智能体评测并列出现。


图片分别来自Kimi K3 Tech Blog与Qwen3.8-Max官方Blog。

这不是又一套代码题。MLS-Bench-Lite从完整评测中选出30个任务,覆盖全部12个机器学习领域,专门考查模型能否围绕真实研究问题提出并实现更好的方法。

2026年6月,Kimi K2.7-Code首次将它纳入官方发布评测;一个月后,Kimi K3再次采用;随后Qwen3.8-Max也把它写进官方发版结果。对于一个刚刚提出的研究评测,这种采用速度说明,行业关心的不再只是Agent能不能完成更多编码任务,而是它能不能推动AI本身继续前进。

拿到强方法之后

模型仍在重组答案

论文主实验评测了五个前沿模型。模型既可以直接提交首次方案,也可以进入真实代码库,多轮修改代码、运行实验,再提交最终实现。

研究团队还把强人类基线的代码直接交给模型,其中包括每个问题上公认的SOTA方法。换句话说,模型不是在信息不足的情况下从零猜答案,而是已经站在当前最好方法之上,任务只剩下继续向前一步。

论文主实验的结论很明确:在当时评测的五个模型中,所有模型提出的方法在整体表现上都无法超过Human SOTA。即使模型已经拿到Human SOTA的实现,并被允许进行多轮实验,这一步也没有发生。

随着更强模型进入榜单,汇总分数还会继续上涨,但领先成绩本身仍然不高,评测远未饱和。与此同时,一次总分超过某条基线,并不自动意味着模型发现了新的机制。更关键的问题是,增益究竟来自方法创新,还是来自更充分的调优、搜索与已有组件重组。


网页柱状图按领域展示首次方案、多轮Agent与Human SOTA;论文主实验中,模型方法的整体表现均未超过Human SOTA。

论文进一步检查了模型到底在做什么。结果发现,当提示词从「发现一种新方法」改为「优化现有方案」时,模型反而做得更好。专家逐项分析提交后也看到,模型经常把已经出现过的模块重新排列组合,再把组合包装成新方法;真正新的机制极少,即使偶尔出现,也往往缺少能够解释其有效性的有洞见假设。


专家案例分析显示,模型提交往往紧贴已经看到的基线组件。

这里出现了一个颇具反差的现象。模型能够读懂代码库,识别多个基线的组成部分,也能把不同组件拼接成一个可以运行的系统。

从工程执行角度看,这已经是一种很强的能力;但从科学发现角度看,它仍然没有回答最关键的问题:为什么需要一个新的机制,它要修正现有方法中的哪项根本缺陷,又凭什么在新的数据和规模上继续有效?

当模型缺少这样的判断时,多轮实验很容易退化成局部爬山。它根据刚看到的结果微调权重、组合模块、修改训练细节,偶尔可以获得增益,却很难形成一个有解释力、可迁移的研究主张。

这不是简单的「分数还不够高」。当前模型离真正的方法发现仍然很远:它们会调参、会改工程、会拼装已知组件,却还不会像优秀的人类研究者那样提出真正有用的算法创新。

外推到科学发现

过去一年,Auto-Research与递归自我改进迅速升温。AlphaEvolve在circle packing等问题上找到更优构造,nanoGPT speedrun也让Agent围绕固定目标不断试错。

与此同时,「自进化」正在变成一个不断扩张的标签。让Agent编写更多项目代码、自动生成技能、更新记忆、清理数据、合成训练样本,甚至优化训练基础设施,都可能被放进AI改进AI的叙事中。

Anthropic在《When AI builds itself》中梳理了一条非常直观的演化路线:模型先是提供代码片段的聊天机器人,随后成为能自己运行代码的编程Agent,再发展到能够分派长程任务的多Agent系统。其内部数据显示,Claude编写的代码已经占到合并代码的80%以上,工程师人均合并代码量也出现显著增长。Anthropic同时把真正「闭环」仍放在未来:由Agent自己构建和训练下一代模型。


图片来自Anthropic的When AI builds itself。

国内也出现了相似叙事。MiniMax M2.7的官方发布把模型创建强化学习技能、更新记忆并优化自身学习流程称为「开启模型的自我进化」。这些进展确实在提高AI研发的自动化程度,但它们主要回答的是模型能否更深地参与已有流程。

更关键的问题还没有因此消失:AI能不能发现人类尚未发现的方法?

这些工作证明了大模型可以成为强大的搜索器,但它们通常拥有一个共同条件:验证便宜、反馈快速、结果能被单一分数清楚判断。系统可以一次生成大量候选,再从中选择最优答案。

真正改变机器学习的方法不是这样诞生的。Attention、残差连接、归一化和Adam的价值,不在于它们只在某一次实验里多赢了几个点,而在于它们换到不同数据、模型和规模后依然成立。支撑科学进步的,是这种能够迁移、能够扩展的方法发现。

这也呼应了Richard Sutton在《苦涩的教训》中提出的标准。长期真正有效的,往往是通用、并能随计算资源继续发挥作用的方法;我们需要的是能够完成发现过程的AI,而不是只装载人类既有发现的系统。

从GAN、Seq2seq、VAE、BatchNorm,到ResNet、Transformer、扩散模型、LoRA、RMSNorm与PPO,机器学习社区的繁荣来自一批经得起时间、领域与规模检验的方法。让AI更快实现这些方法当然重要,但递归自我改进真正有野心的目标,是让AI独立发现下一批这样的方法。

此前没有一套评测真正测量这种能力。很多工程类任务把方法设计、超参数、数据处理和实现技巧混在一起;一些开放式研究任务又只看最终分数,无法判断提升究竟来自算法创新,还是扩大模型、修改评测器等捷径。

现有基准的覆盖方式也存在断层。一类任务本质上是数据挖掘竞赛:给定训练集和测试集,让模型清洗数据、组合现有算法,最后提交预测结果。另一类任务要求Agent生成研究方案或论文,再由语言模型从新颖性、完整性和可行性等维度打分,却不直接运行并比较它提出的方法。前者更接近工程,后者更接近文本评价,都没有正面回答方法到底有没有变好。

MLS-Bench要锁定的,正是这条最难测的能力轴。

140道题

把「方法创新」单独拿出来考

MLS-Bench覆盖语言模型预训练与后训练、视觉生成、强化学习、机器人、机器学习系统、AI for Science、优化与理论、因果推断、时间序列和可信学习等12个主要方向,包含140个来自真实代码库的研究任务。

这个覆盖范围决定了它不是围绕某一种模型能力制作的专门题库。语言模型任务会追问训练目标、优化器和路由机制能否改进;视觉生成任务会涉及采样与生成过程;强化学习与机器人任务需要方法在不同环境中维持收益;系统方向则把算法放回真实吞吐、资源和执行约束中。理论、因果、时间序列与AI for Science又引入了完全不同的归纳偏置与验证方式。

具体任务可以从KV缓存压缩一路延伸到时空交通预测、黑洞图像重建、抗体与抗原结合、机器人世界模型以及训练量化。它们来自不同研究社区,也使用完全不同的指标。这个广度本身就是工作的重要部分:它把「AI还能在哪些问题上推动机器学习」从少数热门案例扩展成了一张跨领域研究地图。

换言之,MLS-Bench不是在寻找一个特别适合Agent的领域,然后据此宣布AI已经会研究。它把今天机器学习研究中一批重要问题放进同一套可执行评测,希望观察一种能力能否跨越领域边界:模型是否能识别现有方法的实质局限,并提出在多个条件下仍然成立的改进。

每道题都不是复述论文,也不是复现已有结果。模型需要围绕一个明确问题,设计新的优化器、训练目标、注意力变体、采样策略或路由规则,并提交真正可以运行的代码。

每个任务至少包含3个检验迁移能力的测试环境,以及至少3个强人类基线,其中包括领域公认的SOTA。所有基线都由研究团队在同一套代码与评测流程中重新实现和校准。

这里的「强基线」不是论文中抄来的一行数字。研究团队需要把至少三种具有代表性的人类方法重新接入任务,确认它们能够在统一代码库中恢复应有表现。只有这样,模型最终超过或落后于基线时,差异才不会来自不同训练代码、数据版本或实现质量。

这个过程同时校准了任务边界。如果最强的人类方法无法在允许修改的范围内表达,限制就过严;如果模型可以随意改动数据、训练预算或评分流程,限制又过松。每个任务都要在这两者之间找到可验证的边界:它既容纳真正的方法创新,又排除与研究问题无关的取巧空间。


模型与人类基线在相同代码库、相同训练协议和多个测试环境中接受比较。

为了确保测到的是目标研究问题,团队冻结数据管线、评测器和共享训练协议,只开放需要研究的组件。如果任务涉及模型结构,系统还会检查参数规模,防止模型靠增加容量换分。只在可见环境中提高分数、换到其他数据或规模便失效的方案,也不会被视为真正进步。

不同任务会用不同方式检验这种迁移。有的更换数据集,有的更换模型尺度,有的更换环境或训练条件。模型不能只针对眼前反馈写一个特例,也不能靠记住某个公开测试集的规律拿分。一个候选方法必须在至少三个条件下继续带来收益,才有资格被称为方法层面的进步。

团队还做了一项直接的防作弊消融:移除模型规模检查。结果,被测模型会通过增加参数量获取更高分,部分结果甚至能轻易超过强人类方法。重新打开检查后,这条捷径消失。这个实验说明,如果不锁住容量等变量,一张看似亮眼的自动研究成绩表,很可能测到的只是模型发现了一个更大的网络。

这套严格控制非常关键。它让最终结果能够回答一个过去一直含混的问题:分数上涨,到底是方法变好了,还是工程空间变大了?

更多采样有用

但跨不过方法发现的门槛

把推理预算继续拉高,能否解决问题?


更多迭代和大规模测试时采样可以带来收益,但提升很快触顶。

实验显示,增加迭代次数和测试时采样确实能够提高成绩,但主要作用是继续搜索和打磨已有方向。简单任务上的收益很快饱和;当模型只能看到部分环境的反馈时,继续搜索还可能过度适应可见结果,反而损害未开放环境中的表现。

这对当前流行的「推理时算力能够解决一切」提出了一个具体边界。测试时扩展擅长在已经定义好的候选空间中增加尝试,但方法发现要求模型先创造一个值得搜索的新空间。前者可以通过更多样本提高命中率,后者则需要对问题结构形成新的判断。只增加尝试次数,并不会自动补上这一步。

研究团队随后把模型放进一个更接近真实预训练研究的场景。原本可用于三次完整345M参数训练的算力,被改成可自由支配的实验预算。模型可以自行决定代理模型大小、训练token数、实验次序,以及何时进行昂贵的完整验证。

自由更多,结果却通常更差。有的模型积极消耗预算,最终性能下降;唯一取得提升的模型反而只使用了很少算力。


算力机会更多,并不意味着模型会自动选择更有信息量的实验。

这揭示了比「想不出新点子」更深的瓶颈。科学研究还需要判断什么假设值得验证、哪个小实验最有信息、什么时候证据足够,以及何时应该停止一条错误路线。当前模型不仅缺乏方法创新,也缺乏建立和验证证据所需的更广泛科学判断力。

研究团队还测试了一个看似直接的补救方向:给模型更多外部知识。模型可以使用网页搜索,也可以拿到基线论文的详细推导和相关理论背景。然而这些额外信息带来的整体增益仍然有限,许多情况下甚至没有明显超过普通的多轮实验。


增加网页搜索、推导和理论背景,只带来有限改善。

这意味着瓶颈并不只是「模型没读过这篇论文」。知道更多术语、公式和相关方法,不等于能够提出一个有洞见的假设;提出一个听起来合理的假设,也不等于能够设计出足以区分多种解释的实验。知识检索解决的是信息可得性,科学判断解决的却是下一步该相信什么、验证什么。

自进化AI

下一步不能只靠堆搜索

MLS-Bench最终提出了一个更根本的范式问题。

今天这条路线并非凭空出现。从AlphaGo、AlphaZero的博弈树搜索,到AlphaTensor把数学结构转化为可搜索对象,再到FunSearch和AlphaEvolve让语言模型生成代码候选,核心循环逐渐稳定为:提出大量方案、自动执行、按分数筛选,再用优胜者生成下一轮候选。


从AlphaGo到AlphaEvolve,搜索对象从棋局逐渐扩展到程序与算法。图源:作者报告。

这条路线之所以强大,是因为它把模型的生成能力接到了一个明确验证器上。只要每个候选都能快速、可靠地得到分数,增加采样就能系统性地扩大搜索范围。AlphaEvolve不只解决数学构造,也优化了数据中心调度、芯片设计和Gemini训练流程,说明这种范式并非没有现实价值。

当验证器廉价而明确时,扩大采样规模是一条有效路线。但真实科学发现中的验证往往昂贵、延迟、多阶段,而且只能观察到部分结果。模型无法无限调用一个便宜评分器,只能提出有洞见的假设,用有限实验取得信息,再决定哪条路线值得投入更多算力。

论文将这项挑战概括为:在验证难以规模化的条件下,实现可规模化的科学发现。

传统代码评测正在逐渐饱和,AI for Research很可能成为下一个真正拉开模型差距的前沿。Kimi K3和Qwen3.8-Max已经将MLS-Bench-Lite纳入官方发布,只是这场长期测量的开始。

真正的递归自我改进,不是让AI更快地搜索人类已经定义好的空间,而是让它有一天能够独立提出、验证并建立那些真正推动AI继续前进的方法。

参考资料:

Kimi K3 官方博客:https://www.kimi.com/blog/kimi-k3

Qwen3.8-Max 官方博客:https://qwen.ai/blog?id=qwen3.8

Anthropic《When AI builds itself》:https://www.anthropic.com/institute/recursive-self-improvement

MiniMax M2.7 官方发布:https://minimaxi.com/news/minimax-m27-zh - Richard Sutton《The Bitter Lesson》:https://bitterlesson.ai/

Google DeepMind AlphaEvolve:https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/

编辑:LRST

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
华国锋夫人韩芝俊现年91岁,生活朴素,坚持上下班骑自行车

华国锋夫人韩芝俊现年91岁,生活朴素,坚持上下班骑自行车

旧闻档案馆
2026-10-03 09:30:29
仅21岁广西姑娘凌晨去世,男友三次改婚期,最后聊天记录看哭全网

仅21岁广西姑娘凌晨去世,男友三次改婚期,最后聊天记录看哭全网

青杉依旧啊啊
2026-10-02 16:04:23
西湖醋鱼真这么难吃?网友:我一生节俭的奶奶吃了一口 没打包

西湖醋鱼真这么难吃?网友:我一生节俭的奶奶吃了一口 没打包

许三岁
2026-09-26 21:39:03
果然,中餐才是最牛的!网友:他们整整吃了一年煎饼!

果然,中餐才是最牛的!网友:他们整整吃了一年煎饼!

另子维爱读史
2026-09-29 21:07:58
国庆高速彻底失控!大批车主崩溃:这辈子再也不开电车长途

国庆高速彻底失控!大批车主崩溃:这辈子再也不开电车长途

石辰搞笑日常
2026-10-03 13:36:30
霍尔木兹海峡运油刚恢复,美军就开始派兵加码!三航母群即将在中东汇合

霍尔木兹海峡运油刚恢复,美军就开始派兵加码!三航母群即将在中东汇合

红星新闻
2026-10-02 16:21:34
江苏一区长代表资格被终止,仕途为何急转直下?

江苏一区长代表资格被终止,仕途为何急转直下?

吃货的分享
2026-10-03 02:13:50
退休人最幸福的七类人:占2个就是顶配,看看你中了几条?

退休人最幸福的七类人:占2个就是顶配,看看你中了几条?

荷兰豆爱健康
2026-09-30 04:59:46
皇马中锋埃斯皮创西班牙历史!单场进5球、造7球,助球队 13-0 大胜

皇马中锋埃斯皮创西班牙历史!单场进5球、造7球,助球队 13-0 大胜

福酱的小时光
2026-10-02 18:36:44
178万成交!这样的1角纸币,再破都值钱!

178万成交!这样的1角纸币,再破都值钱!

天天纪念币
2026-08-09 10:05:46
30万斤堆积如山,树上6万斤无人问津,低价卖不动,农民满心无奈

30万斤堆积如山,树上6万斤无人问津,低价卖不动,农民满心无奈

三农雷哥
2026-09-05 12:16:13
美国广播公司,ABC:迪拜航空飞行员供认,企图驾机撞向以色列。

美国广播公司,ABC:迪拜航空飞行员供认,企图驾机撞向以色列。

梦在深巷aqa
2026-10-03 12:25:12
北理工事件再发酵!裴轶付出了代价,在公安大学任职的丈夫被曝光

北理工事件再发酵!裴轶付出了代价,在公安大学任职的丈夫被曝光

平老师666
2026-10-01 22:23:27
全国理发店开始倒闭潮!明明没电商冲击,为什么还会自己干到黄?

全国理发店开始倒闭潮!明明没电商冲击,为什么还会自己干到黄?

抽象派大师
2026-10-03 03:29:12
12秒09!奥运夺冠2年后世界纪录,拉塞尔复制刘翔神迹,巴西破400栏WR

12秒09!奥运夺冠2年后世界纪录,拉塞尔复制刘翔神迹,巴西破400栏WR

独坐山巅前
2026-08-28 06:34:26
真的有人喜欢微胖吗?一个人的时候,常常会感到不自信

真的有人喜欢微胖吗?一个人的时候,常常会感到不自信

娱你同欢
2026-07-31 23:28:29
电视剧《喜剧之王》正式官宣定档

电视剧《喜剧之王》正式官宣定档

可乐谈情感
2026-10-03 02:00:17
高市早苗强硬路线的幕后操盘手:竟然是个在中国长大的"日本通"

高市早苗强硬路线的幕后操盘手:竟然是个在中国长大的"日本通"

你是我的一个梦
2026-08-27 17:15:45
1984年两暴徒袭击金华武警驻地,致38名战士死伤,结局太惨

1984年两暴徒袭击金华武警驻地,致38名战士死伤,结局太惨

莫地方
2026-09-17 23:43:04
净利暴增370%却13连跌停!割肉就反弹25%,A股扎心一幕

净利暴增370%却13连跌停!割肉就反弹25%,A股扎心一幕

慧眼看世界哈哈
2026-10-03 11:03:38
2026-10-03 16:55:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16336文章数 67113关注度
往期回顾 全部

科技要闻

英伟达盘中创历史新高,市值逼近6万亿美元

头条要闻

马斯克断崖式分手4娃高管 女方并非小娇妻而是大女主

头条要闻

马斯克断崖式分手4娃高管 女方并非小娇妻而是大女主

体育要闻

这个讨论了一夏天的问题,马刺有答案了吗

娱乐要闻

假期快乐!贾乃亮晒和甜馨国庆出游照

财经要闻

4亿台电视挂墙落灰 为何没人愿意开了?

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

健康
房产
家居
亲子
公开课

刷酸祛痘,为什么有人翻车?

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

又被这俩小子给套路了

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版