ICML 2026 Oral论文CausalGame公布了一项颇为残酷的评测结果:30款当前最顶尖的大语言模型智能体,在面对因果推理任务时,全部折戟。
没有一款模型通过测试。研究团队据此指出,哪怕是大众眼中能力超群的LLM,在科学发现所必需的因果推断能力上,依然近乎空白。
![]()
这也说明,被频繁提及的“AI科学家”离真正意义上能够自主完成科学发现,仍有不小的距离。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.