当Kimi K3与Qwen3.8-Max的官方评测报告纷纷引用同一套基准测试时,很少有人注意到,这份来自伯克利大学的最新研究,正在掀翻AI行业最引以为傲的叙事。 MLS-Bench,一个专门检验AI“方法发现”能力的硬核测试,给出了一个令人不安的结论:当前最先进的大模型智能体,在自我进化的道路上,实际只完成了“表面功夫”。 这项测试的设计逻辑直击要害——它将AI解决问题的能力拆解为两个层面:一是“组件优化”,即在已有框架内调整参数、修复缺陷;二是“方法发现”,即从零创造全新的解题路径。结果显示,几乎所有主流模型在后者上的表现,都远远落后于前者。 更值得玩味的是,Kimi K3与Qwen3.8-Max这两款国内顶尖模型,恰恰都是在MLS-Bench上“优化”得分亮眼,却在“发现”维度上暴露了天花板。这意味着,所谓“AI自主进化”,很多时候不过是在既定路线图上跑得更快,而非真正开辟新地图。 伯克利团队在论文中直言不讳:如果方法发现是所有科学突破的前提,那么当前AI研发体系所追捧的“大力出奇迹”路线,可能正在制造一种假性繁荣。 这一发现对Auto-Research(自动科研)领域的冲击尤为直接。许多实验室宣称AI已能独立完成科研闭环,但MLS-Bench的数据表明,智能体在假设生成、实验设计这些最核心的创造性环节上,依旧高度依赖人类预设的思维模板。 换句话说,AI能帮你把已有论文中的方法组合出花来,却很难像牛顿面对苹果那样,问出一个前所未有的问题。当行业陷入“内卷式优化”时,真正的革命性进展,可能恰恰卡在人类自己设定的数据与算力框架之内。 伯克利的这盆冷水,浇得正是时候。它提醒我们,在追逐参数规模与榜单分数的同时,或许该重新审视:我们究竟想要AI学会什么?
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.