当一个时代的知识生产方式发生重大或根本性改变的时候,与之相伴的科研评价方式也必将随之改变,否则在微观层面将无法有效规训、引导与激励科技共同体的行为;在宏观层面则呈现为知识生产流程的断裂并最终导致无法实现国家的意志或目标,甚至会造成科技界认知的混乱与无序。据新智元10月4日文章披露:arXiv 正式实施最严新规:每人每月限发2篇论文,拒稿也算!从10月1日起,在 arXiv 上挂论文有了次数限制。这一切皆源于今年9月,arXiv收到40363篇投稿,创下单月纪录。早在2016年9月,arXiv 的月投稿量还不到一万篇,用了八年才涨到两万;从两万涨到四万,只花了两年。随着AI工具的日益强大与便捷,这种投稿井喷现象将成为常态,这种论文的井喷带来的第一个困难就是,那些论文的结论可靠吗?谁来验证?这些缺乏验证的知识还是知识吗?
一 、开始批量生产答案的人工智能
过去几年,人工智能在科学中的角色发生了明显变化。它曾主要被用来整理数据、加速计算或辅助写作,如今却开始直接参与提出猜想、搜寻反例、构造证明和筛选实验对象。DeepMind的FunSearch曾在组合数学问题中找到优于已知方案的新构造,AlphaProof与AlphaGeometry 2在国际数学奥林匹克竞赛中达到银牌水平。在数学之外,AlphaFold改变了蛋白质结构预测的速度与规模,GNoME则大幅扩展了候选稳定晶体结构的搜索范围。
进入2026年,多起数学新闻把这一趋势推向更高点。AI系统被报道用于推翻单位距离问题中的一项长期猜想、寻找雅可比猜想在三维及更高维情形的反例以及推进孪生素数猜想研究。OpenAI还公布了一份纳维-斯托克斯方程相关证明,声称解决了一项千禧年难题。截至2026年10月2日,克雷数学研究所(Clay Mathematics Institute)仍将该问题列为尚未解决,这也提醒我们:模型给出了答案,不等于共同体已经完成审查并接受它。这些事件中,所获成果最终是否成立当然重要,但更值得关注的是这样一个科学研究大趋势,即AI已经从科学家手中的工具,逐渐变成了候选答案的生产者。一个模型可以并行尝试大量路径,迅速淘汰失败方案,并把少数有希望的结果送到人类面前。
于是我们发现,科学知识生产似乎正在进入一个答案高产的时代:难题依然存在,但候选定理、分子结构、材料配方和实验假设的产生速度,可能已经超过了人类验证、理解和吸收它们的速度。而这也正是多位菲尔兹奖得主联名发表《人工智能在数学中的严重错位》的背景。声明批评以“攻克著名难题”作为AI进步的主要尺度,因为这种叙事容易把科学简化为一张待完成的题单,挤占概念理解与洞见的空间,从而偏离数学研究的目标。这不仅仅是数学界应当关心的问题,当AI开始批量生产答案,整个科学共同体都需要回答这样一个问题:我们还能否用“发现了多少”来衡量科学的价值吗?
二 、从答案到知识:科研评价面临的挑战
首先需要声明的是,科学并不排斥由机器生成的结果。计算机证明、数值模拟和高通量实验早已表明,研究者可以借助人类无法逐步完成的计算获得可靠结论。问题在于,答案与知识之间,还隔着验证、解释和共同体接纳。
如果AI给出一项结果,人类却无法检查它,这项结果就只是一个待验证的声称。如果结果可以验证,却没有人能说明其中的机制、条件和适用边界,它可以成为可靠信息,却未必已经形成充分理解。只有当结果能够被检验、解释、质疑、教学,并迁移到新问题中,它才进入一个可积累的知识体系。答案指向的是:结论是什么?但知识还意味着这样一些问题:我们为什么相信它以及它能帮助我们继续做什么。
二者间存在的距离使得现行科研评价的局限更为突出。论文数、引用数、专利数和著名难题的攻克数,都比较容易被记录和比较。可是,它们主要计量知识生产链条的末端产物,很难看见一个好问题的提出、一次严格复核、一种可理解的解释,或一套让他人能够重复研究的数据与工具。莱顿宣言早已提醒学界,定量指标应服务于专家判断,而不应取代判断。AI的加入让这一提醒更加迫切:当生成结果的边际成本大幅降低,产出的数量就更难直接等同于贡献的质量。
AI还可能把科研的瓶颈从“生成”推向“审查”。候选结果越多,共同体越需要投入稀缺的专家时间去鉴别新颖性、检查正确性和判断重要性。如果评价体系仍然奖励最快公布和最多发表,研究者就有动机把未充分检查的结果涌向公共空间,而验证、失败复现、数据整理和理论综合等工作反而更难获得承认。最后增长的可能是信息负担,而不是可信知识。
因此,AI时代的科研评价需要从结果计数转向知识质量。评价一项工作时,除了问它得到了什么,还应当考察问题是否值得研究,AI在其中扮演了什么角色,结果能否被独立验证,解释是否足以支撑推广,以及数据、代码和推理过程能否被后来者继承。这些维度也许比单纯增加一个AI论文标签更重要,因为它们直接回答了一项成果能否变成公共知识。
三 、重新规范AI时代的科学发现者
历史上,科研规范一直在随着科学的组织方式而变化。近代科学共同体通过学会、期刊和公开实验逐步建立优先权、公开说明和可重复检验的惯例。进入20世纪后,科学研究更加专业化、机构化,规范也从学者之间的声誉约束,逐渐发展为同行评议、作者责任、利益冲突披露、数据管理、勘误与撤稿等制度。科研规范的发展史,实际上就是科学共同体不断回答两个问题的过程:什么样的知识值得相信,以及谁应对它负责。
1942年,科学社会学家罗伯特·默顿(Robert K. Merton)将现代科学的价值准则概括为普遍主义、公有性、无私利性和有组织的怀疑。普遍主义要求按证据而非按身份评价主张;公有主义强调科学成果应进入可共享的知识库;无私利性要求研究者接受公共检验,而不把私人利益凌驾于求知之上;有组织的怀疑则要求任何结论都保持可质疑、可复核的状态。这四项准则至今仍有解释力,但它们默认的行动主体是人类科学家,责任也主要通过作者、编辑、评审人和机构来承担。
当前的专业规范已经开始回应AI时代的科学研究模式。2025年通过的《欧洲数学学会数学出版实践准则》要求作者声明在内容创作中使用了哪些AI或自动化工具、如何使用,并由人类作者对内容和最终形式负全责。它还要求评审人保护稿件机密,不得随意将未公开稿件上传至外部服务;若用AI起草审稿意见,则需向编辑披露。美国数学学会的伦理指南强调正确归功、及时公布完整证明、纠正错误,并对作者、编辑和评审人的责任作出规定;其AI出版政策则不承认AI的作者资格,要求披露使用情况,并把责任留给人类作者。
这些规定十分必要,因为它们在AI已经进入研究和出版流程的情况下,继续保护诚信、机密性和责任追究。但它们的主要做法,仍是规定人应该如何使用AI:人来披露,人来署名,人来承责。这可以处理AI辅助写作或审稿的情形,却还不足以应对一个能够自主搜索、连续生成猜想并批量输出候选成果的系统。一旦发现过程分布在模型、训练数据、算力平台、提示与工具链、人类研究者和审查机构之间,只问作者是谁就很难说清成果是如何产生的,也无法完整分配责任。
因此,在AI时代,我们或许需要把科研规范的对象从单个科学家扩展到人机科研系统。第一,建立过程追溯规范。研究者不仅要说明使用了AI,还应记录关键模型版本、数据来源、工具调用、人类选择与验证环节,使结果能被审计。第二,建立分级验证规范。AI生成的候选结果不应默认拥有与经过独立复核的成果相同的地位;越是重大、越是难以解释的主张,越需要多路径验证。第三,建立责任分配规范。论文作者对公开主张承担直接责任,模型和平台提供者则应对系统能力说明、风险控制和可审计性承担相应责任。
评价制度也要为这种转变提供正向激励。评聘、资助和奖励不应只看结果的数量或新闻效应,还应承认提出重要问题、独立验证AI结果、说明失败边界、建设开放数据与验证工具,以及把晦涩结果转化为可理解理论的贡献。当这些工作能够获得与首次发现相称的声誉与资源,科学共同体才不会被大量候选答案所淹没。
总之,当答案不再稀缺,科学中真正稀缺的将是选题的判断力、验证的耐心、解释的深度和公共责任。科研评价的任务,不是在人与机器之间争夺发现者的称号,而是促使人机共同产生的结果经过检验、获得解释,最终成为可以被共同体使用与继承的知识。
赵长征,南京大学哲学学院博士生;李侠,上海交通大学科学史与科学文化研究院教授。文章观点不代表主办机构立场。
◆ ◆ ◆
编辑邮箱:sciencepie@126.com
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.