一篇新近发布的立场论文,给当前火热的“AI科学家”研究泼了一盆冷水。论文认为,整个领域可能从一开始就优化错了单位——真正的评估对象不该是孤立的AI智能体,而是“科学家+AI”组成的人机协作系统。
这篇题为《Position: AI Agents in Scientific Teams Should Be Studied as Human-Agent Systems》的论文,核心观点很直接:科学智能体应当被当作“人-智能体系统”来研究,评估的单元是科学家与智能体的配对组合,而不是智能体单独的表现。
![]()
现状:人类被当成“监督者”
论文指出,目前大多数系统仍然把人类当作监督者来使用:设定目标、审查某个阶段、批准最终成果。真正为工作中持续、细粒度协作而设计的系统,要少得多。
问题在于,智能体天然不知道什么时候需要人类介入。论文提到,在10个科学任务中,GPT-5-mini几乎从不主动寻求帮助。
关键发现:协作收益来自“配合”而非“自主”
但人类的输入恰恰是重要的。在论文的案例研究中,专家发现了智能体遗漏的错误,而智能体则加快了执行速度。收益来自协作,而不是自主性。
换句话说,人机各有所长:人类擅长发现方向性错误,AI擅长提速执行。两者配合的产出,优于任何一方单打独斗。
新基准:团队产出是否优于任何一方单独表现?
基于此,论文提出的评估基准也完全不同:人机团队能否产出比任何一方单独工作都更好的科学成果,同时协作成本不至于压过收益?
这个基准把问题从“AI能做什么”转向了“人+AI一起能做什么”,并且把协作成本纳入了考量——如果为了协作付出的时间精力超过了协作带来的增益,那这套系统就不算成功。
论文目前可在arXiv上查阅,编号为abs/2608.14667。对于正在设计AI科研助手的研究团队来说,这篇论文提供了一个值得重新审视的评估视角。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.