编者按:Carlos Enrique Arleo是英国Localis AI负责人,其研发的"颠覆性与创新点指数"(DNI)系统在2025—2026年度元科学新颖性指标挑战赛中获特别提名。在本文中,Carlos基于开发实践,剖析了AI评估科研创新性的技术路径与底层困境,提出以"分析仪器"替代"聊天助手"的设计思路。译者撰写评论,将DNI与德国于利希研究中心获奖方案、上海VIRSCI系统以及美国白宫最新报告并置讨论,描绘了当下AI赋能科研评价的全球前沿图景。
AI创新点评估系统开发后的思考
去年我开始反复思考一个看似简单,但实际要回答却很难的问题:一篇论文的创新点到底有多强?这里所说的“创新点”,不是看行文是否漂亮,也不是看作者是否对自己的观点有把握,我是想建立一套相对明确的标准,用量化的方式来评估论文的创新点。之前的AI系统开发经验,让我意识到AI或许能为这个问题提供一种新的解决思路。
于是,我开发了一个名为“颠覆性与创新点指数”的工具,(Disruption & Novelty Indicator,DNI)。DNI的最初版本在“2025—2026年度元科学新颖性指标挑战赛”中获得特别提名。这项匿名评审竞赛由英国元科学部门、Nesta、兰德欧洲研究所、苏塞克斯大学科学政策研究中心(SPRU)以及Challenge Works共同组织。首先需要说明,DNI 输出的是指标,而非精确测量值——它只是新颖性的代理表征,不能直接等同于新颖性本身;厘清这一点,决定了我们不能把它的评估结果看得过重。
目前大多数AI工具都是聊天助手形式。用户向模型提问题,希望得到一个确切的答案,但模型给出的回答多少带点谄媚。它通常会尽可能生成一段听起来合理、完整,同时也让提问者感到满意的内容。所以我更愿意把AI看作一种分析仪器。使用仪器时,我们不是向它征求意见,而是让它按照预先设定的程序,在明确的证据范围和评价标准内运行。AI也是如此:与其问模型“你怎么看”,不如直接给它规则和指标,让它分析。这样得到的就不再是一场友好的对话,而是一份依据既定标准形成的评价结果。这也是DNI最基本的设计思路。问题在于,为什么AI很难判断“这项研究是否有创新性”?那些看似可行的捷径又为何都走不通呢?
第一条捷径:直接将论文粘贴到对话式大模型中寻求评估,而这种方式从底层逻辑上就存在缺陷。大模型的架构让它倾向于顺着问题生成回应。当你询问自己的论文是否新颖时,它很可能构造出一套听起来颇为可信的理由,肯定论文的价值。至于这些理由是否有充分的文献比较和事实基础上,就不一定了。近期的一项评测基准NovBench,专门考察AI系统能否识别真正的科学贡献,而不只是流畅地描述所谓的“创新点”。其结论触及了问题的核心:大语言模型往往更擅长表述新颖性,却未必真正理解新颖性。更严重的是,如果模型只能依赖自身模糊的“记忆”来解释为什么一篇论文具有创新性,它还可能编造并不存在的参考文献,为一个原本缺少依据的判断补充证据。所以那些试图让AI一次性完成论文质量、方法、意义、新颖性和可信度等全部评价的系统,往往容易因为大模型的“糊弄”而失效。
评估新颖性或许需要更简洁的办法:不让机器评价整篇论文的所有方面,只让它回答一个具体问题——论文的核心观点与已经发表的研究相比,究竟有多大差异?DNI的功能就是这样,它通过严格设定的程序和规则,将一篇新论文或一个新观点与既有研究进行对照。它并不打算替代完整的同行评议,也不试图判断论文的全部学术价值,只聚焦于核心思想与现有文献之间的差异。
第二条捷径是传统文献计量思路:把论文文本转化为一组数值(向量),将其映射到数学空间中,与参考数据库内所有论文并列,再测算它与周边文献的距离远近。这种方法速度快,成本低,但完全舍弃了文本内在论证逻辑。一篇论文之所以落在空间地图上的“无人区”,有可能只是行文怪异、关键词组合冷门,并非核心思想真正具备原创性。DNI试图避开这类捷径。它也不把期刊声望或引用次数当作研究新颖性的替代指标,而是希望在阅读论文的同时,直接从论文的论点、证据以及与既有研究的关系中作出判断。
DNI系统的设计建立在三项核心原则之上:
第一,阅读全文,而不是只看摘要
第二,检索真实文献:不依赖模型模糊记忆中的 “相关文献”,而是提取论文正文列出的参考文献,实时对接 OpenAlex、Crossref、Semantic Scholar三大数据库核验文献真实性,并调取文献原文,之后再开展论文评估;
第三,让多个AI评审在明确维度内评分
DNI会设置5至10个相互独立的AI评审,从四个维度评价一项研究。
第一个维度是独特性,主要判断论文提出的核心主张,与检索到的已有研究相比,原创程度如何。
第二个维度是挑战与替代程度,也就是论文在多大程度上对现有共识提出挑战,或者试图用一种新的解释框架取代既有观点。
第三个维度是综合性,关注论文是否实质性地连接了原本相对分离的学科、理论或研究传统。
第四个维度是连贯性。这一维度相当于一道基础门槛:如果论文自身的论证并不成立,前面几个维度的高分也就缺少意义。
在评估过程中,不同AI评审的权重并不完全相同,以避免某一个模型实例主导最终结果。如果评审之间出现较大分歧,系统也不会简单地把所有分数取平均,而是会自动启动第二组评审。
大语言模型不应该在没有边界的情况下自由判断一篇论文是否新颖。DNI允许模型在结构化框架中进行分析,但在模型之外,还设置了由程序执行的硬性规则,用来检查和修正输出。例如,系统设置了一个“综述上限”。如果一篇文章被识别为文献综述或综合性研究,那么无论AI评审给出多高的分数,其最终得分都不能超过0.45。
系统的早期测试暴露了一个非常典型的问题。我故意写了一篇虚假论文。文章中使用凭空捏造的计量单位,跨领域乱用物理学公式,完全没有实证数据。结果,系统将这篇论文评为“中度新颖”,得分达到0.70。看似逻辑通顺的虚假内容极易蒙蔽 AI 评审单元,因为它模仿了突破性成果的文本特征。每一个评审单元都按规则正常运行,只是这篇造假论文刚好能够同时满足所有评判条件。
为此,我在系统中加入了一道“真实性筛查”,重点检查研究是否具有实证基础,观点是否能够证伪。再次运行后,这篇虚假论文被系统标记,得分从0.70降至0.40,报告中还特别指出了其中使用的虚构计量单位。
在另一次测试中,我选取了同一位作者在五个月内发表的两篇相关论文。第一篇主要提出一个理论框架,第二篇则是后续的实证研究。两篇文章讨论的是同一个基础问题,但贡献形式并不相同。系统最终将第一篇论文识别为综合性研究,并按照规则将其得分限制在0.45;第二篇实证论文则被评为高度新颖,得分达到0.72。这一结果表明,预先设置的程序规则可以在没有人工干预的情况下,对不同类型的学术贡献作出一定区分。虽然多次运行下系统输出结果具备稳定性,但存在一个重大局限:结果尚未依托人类专家评判完成校准。将这套自动化评估结果和领域评审人的真实意见相互比对,是接下来最关键的验证工作。
DNI还不是一个成熟产品,也不能替代同行评议,更不应该被用来裁定一项研究的最终价值。现阶段它是一个数据与机理融合的AI试验平台,用来给论文作者和文献分析人员在投稿之前发现一些潜在问题:审稿人可能提出哪些质疑,论文结构是否存在缺口,某些重要主张是否缺少证据支持。对于科研资助机构,它还可能有另一种用途:评估那些旨在资助高风险研究和非常规研究的项目,最终是否真的支持了原本希望支持的工作。DNI提供的多维度评分,可以作为此类回顾性评估的一项参考,但不能成为唯一依据。由于系统还没有经过人类专家判断的校准,最重要的工作仍在后面。公开这个项目,并不是为了宣布AI已经能够识别科研创新,更不是为了宣称机器可以取代专家。真正的目的,是找到这种自动化推理在应用中什么情况下会失效。
我们近期启动了一次小规模的公开测试,希望进一步检验DNI系统的局限。使用者可以提交论文草稿或DOI,并获得一份完整的DNI评估报告。报告将列出各维度得分、不确定性区间,以及系统触发了哪些硬性分数上限或风险标记。如果系统错误地质疑了一种合理的非常规理论,或者遗漏了人类评审者一眼就能识别的问题,这不代表DNI系统失败。恰恰是这类反馈,能够帮助我们认清人工智能在科研评价领域的能力边界。
评论:科学“黄金时代”,亟需AI原生科研制度
AI能否有效甄别科研领域的“真创新”,表面是技术评价问题,深层是科研组织范式的系统性变革。
文章作者参加的英国元科学新颖性指标挑战赛,获胜者是德国于利希研究中心(Forschungszentrum Jülich)。他们的新颖性评估工具摆脱了传统依靠事后引用量评判成果的滞后模式,立足论文发表时点的学术语境,还原当期研究进展与知识缺口,通过研判研究是否提出新方法、破解长期难题、产出突破性结论,输出可解释的新颖性评分、误差区间与判定依据。该赛事以十万篇论文及领域专家匿名评分为基准,于利希方案的综合研判效果位居榜首。
上海市科学学研究所与浦江实验室合作研发的VIRSCI系统,则将探索重心前置至科研创意生成环节。平台依托多智能体虚拟科学家协同机制,自主完成课题研讨、文献梳理、方案迭代与交叉评议。系统将科研时序划分为过往知识积淀与未来发展趋势,要求优质创新既要与已有研究形成有效差异,也要贴合后续真实落地、具备学术影响力的研究方向。这一定义让科研新颖性跳出了浅层文本差异化的局限,成为衔接存量知识与未来科研趋势的动态价值标准。
两项成果分别锚定科研链条的创意前端与评价终端,共同印证AI赋能科研已迈入全新阶段。全球AI for Science的竞争逻辑已然迭代,不再局限于科研环节的效率提升,而是转向AI原生(AI Native)科研体系的全方位搭建与落地。
2026年7月,美国白宫发布《科学:一个新的黄金时代》报告,明确提出科研体系需围绕AI完成底层重构。当前主流的科研资助、学术出版与成果署名机制,均适配传统人类科研模式,难以适配人机协同的新型科研形态。报告提出,需构建更高效、更开放的学术发表机制,细化AI参与科研的贡献认定标准,革新科研资源配置逻辑,同时布局自动化实验室、AI验证基础设施、X-Labs等新型科研载体。
报告特别警示:AI大幅降低了知识生产成本,却未同步削减验证成本;若资助、发表、评价的制度改革持续滞后,单点科研效率的提升,无法转化为整体科学体系的实质性进步。由此可见,AI原生科研体系绝非简单的“科研+AI工具”,而是以AI为核心形成新的科研成果生产关系。科学的真正“黄金时代”,不会依托AI带来的论文数量红利到来。其核心依托,是一套与人机协同科研模式深度适配的全新制度体系:既能加速创新产出、精准甄别优质成果,也能包容非常规探索、有效过滤伪创新噪声,最终实现知识生产效率与科学体系自我纠错、迭代升级能力的双向提升。
文章作者:Carlos Enrique Arleo,英国Localis AI 负责人与核心研究员。翻译与评论:吴琪,上海市科学学研究所 科技与社会研究室副研究员。文章观点不代表主办机构立场。
◆ ◆ ◆
编辑邮箱:sciencepie@126.com
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.