如果AI可以自己提出理论、设计实验、甚至写出论文,那实验室里的博士和教授们,还剩多少存在感?OpenAI在2025年11月20日发布的一份报告,用一整本案例集的篇幅回答了这个让人焦虑的问题——答案直接摊在桌面上:GPT‑5离“独立科学家”还远得很,没有人类把关,它在科研里根本跑不起来。
这份名为《早期科学加速实验(GPT‑5版)》的报告,联合了范德堡大学、加州大学伯克利分校、哥伦比亚大学、牛津大学、剑桥大学、劳伦斯·利弗莫尔国家实验室和杰克逊实验室等一批顶尖机构,横跨数学、物理、天文、计算机科学、生物学和材料科学。参与者不是让模型独自去冲击未知,而是设计了一套严密的人机协作流水线,把“人类判断、验证和归属”牢牢钉在流程的最中心。
![]()
报告的组织方式本身就带着明确的信号。它将所有合作案例归纳为四个层级:独立复现已知结果、进行深度文献搜索、与AI协同作战,以及获取可能具有发表价值的新结果。这个分层不是陈列柜里的装饰——每向上走一级,对验证强度、文档记录和专家审查的要求就成倍增加。能重新发现一个已经被教科书证实几十年的定理,只说明模型可以在受约束的空间里穷举路径;而如果要拿出一项真正可能改变学科的洞见,那就必须有人从头到尾盯着每一步推导、每一行代码和每一个被引用的参考文献。
在全书的叙述里,GPT‑5始终扮演的是一名“辅助者”,而不是一个可以甩手不管的“主角”。提出问题、筛选方法、审视推理逻辑、判断实验结果是否站得住脚——所有这些关键决策节点,全部由科研人员牢牢握在手里。报告特别点明,真正有价值、能推动前沿的研究进展,不是模型灵光一现的产物,而是研究者和AI之间持续拉锯、反复校正之后才出现的。换句话说,哪怕模型能瞬间吐出高引论文般的段落,如果没有人的领域知识和实验标准去筛一遍,那些看起来漂亮的输出,可能第二天就被同行复现失败给摧毁。
为了让所有想冲进AI驱动科研领域的机构和企业少走弯路,报告把“必须先把验证设计进工作流”这句话写了进去,而不是等模型已经产出一堆看起来令人信服的答案后,再手忙脚乱地去补检查环节。研究人员需要系统性评估模型生成的假设、文献线索、代码、数学推理乃至实验设计方案,对照自己的领域知识、已有实验体系和同行评审标准,一粒一粒地过筛。这就意味着,从项目立项时,首席科学家和实验室管理者就必须规划出人手、时间表和审查节点,而不是幻想雇一个API就能自动产出Nature封面文章。
报告同时毫不避讳地摊开了当前系统中那些在科研场景中尤其致命的短板。幻觉问题首当其冲:一个看着逻辑通顺、还带着漂亮LaTeX公式的结论,可能源头是一段压根不存在的引用,或者把A领域的经典实验挪到了完全不相干的B体系里。归因难题同样棘手——当模型给出的思路里有某篇关键论文的影子,却没有明确标出来源,不仅可能让后续研究踩进学术不端的泥潭,更会造成整个知识链条的污染,让后来者花费数月甚至数年去排错。这些局限不是轻描淡写的脚注,而是直指现阶段完全依赖AI搞发现的最核心死穴。
如果把这些信息放进现实的研究管理框架里,就能看出报告真正的意图:它不是炫耀“GPT‑5能做多少科学”,而是划出一条红线,告诉所有打算投入AI辅助发现的人——如果想赌模型可以一步到位地完成从猜想到验证的闭环,那赌注可能会输在不可复现和信任崩塌上。相反,从一开始就把人类专家嵌在每一次推理和决策的中心,把AI当成一种扩增工具而非思考替代品,才有机会在数学前沿、材料设计、基因组学这些高度复杂的领域里,摸到真正可靠且能经得起时间检验的进展。报告里的每一个案例都在重复同一条路径:人类主导、AI执行、人类裁决——这条铁三角,至少在未来很长一段时间里,都将是科学AI应用的默认配置。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.