网易首页 > 网易号 > 正文 申请入驻

AI能判断论文观点到底新不新吗?

0
分享至

编者按:Carlos Enrique Arleo是英国Localis AI负责人,其研发的"颠覆性与创新点指数"(DNI)系统在2025—2026年度元科学新颖性指标挑战赛中获特别提名。在本文中,Carlos基于开发实践,剖析了AI评估科研创新性的技术路径与底层困境,提出以"分析仪器"替代"聊天助手"的设计思路。译者撰写评论,将DNI与德国于利希研究中心获奖方案、上海VIRSCI系统以及美国白宫最新报告并置讨论,描绘了当下AI赋能科研评价的全球前沿图景。

AI创新点评估系统开发后的思考

去年我开始反复思考一个看似简单,但实际要回答却很难的问题:一篇论文的创新点到底有多强?这里所说的“创新点”,不是看行文是否漂亮,也不是看作者是否对自己的观点有把握,我是想建立一套相对明确的标准,用量化的方式来评估论文的创新点。之前的AI系统开发经验,让我意识到AI或许能为这个问题提供一种新的解决思路。

于是,我开发了一个名为“颠覆性与创新点指数”的工具,(Disruption & Novelty Indicator,DNI)。DNI的最初版本在“2025—2026年度元科学新颖性指标挑战赛”中获得特别提名。这项匿名评审竞赛由英国元科学部门、Nesta、兰德欧洲研究所、苏塞克斯大学科学政策研究中心(SPRU)以及Challenge Works共同组织。首先需要说明,DNI 输出的是指标,而非精确测量值——它只是新颖性的代理表征,不能直接等同于新颖性本身;厘清这一点,决定了我们不能把它的评估结果看得过重。

目前大多数AI工具都是聊天助手形式。用户向模型提问题,希望得到一个确切的答案,但模型给出的回答多少带点谄媚。它通常会尽可能生成一段听起来合理、完整,同时也让提问者感到满意的内容。所以我更愿意把AI看作一种分析仪器。使用仪器时,我们不是向它征求意见,而是让它按照预先设定的程序,在明确的证据范围和评价标准内运行。AI也是如此:与其问模型“你怎么看”,不如直接给它规则和指标,让它分析。这样得到的就不再是一场友好的对话,而是一份依据既定标准形成的评价结果。这也是DNI最基本的设计思路。问题在于,为什么AI很难判断“这项研究是否有创新性”?那些看似可行的捷径又为何都走不通呢?

第一条捷径:直接将论文粘贴到对话式大模型中寻求评估,而这种方式从底层逻辑上就存在缺陷。大模型的架构让它倾向于顺着问题生成回应。当你询问自己的论文是否新颖时,它很可能构造出一套听起来颇为可信的理由,肯定论文的价值。至于这些理由是否有充分的文献比较和事实基础上,就不一定了。近期的一项评测基准NovBench,专门考察AI系统能否识别真正的科学贡献,而不只是流畅地描述所谓的“创新点”。其结论触及了问题的核心:大语言模型往往更擅长表述新颖性,却未必真正理解新颖性。更严重的是,如果模型只能依赖自身模糊的“记忆”来解释为什么一篇论文具有创新性,它还可能编造并不存在的参考文献,为一个原本缺少依据的判断补充证据。所以那些试图让AI一次性完成论文质量、方法、意义、新颖性和可信度等全部评价的系统,往往容易因为大模型的“糊弄”而失效。

评估新颖性或许需要更简洁的办法:不让机器评价整篇论文的所有方面,只让它回答一个具体问题——论文的核心观点与已经发表的研究相比,究竟有多大差异?DNI的功能就是这样,它通过严格设定的程序和规则,将一篇新论文或一个新观点与既有研究进行对照。它并不打算替代完整的同行评议,也不试图判断论文的全部学术价值,只聚焦于核心思想与现有文献之间的差异。

第二条捷径是传统文献计量思路:把论文文本转化为一组数值(向量),将其映射到数学空间中,与参考数据库内所有论文并列,再测算它与周边文献的距离远近。这种方法速度快,成本低,但完全舍弃了文本内在论证逻辑。一篇论文之所以落在空间地图上的“无人区”,有可能只是行文怪异、关键词组合冷门,并非核心思想真正具备原创性。DNI试图避开这类捷径。它也不把期刊声望或引用次数当作研究新颖性的替代指标,而是希望在阅读论文的同时,直接从论文的论点、证据以及与既有研究的关系中作出判断。

DNI系统的设计建立在三项核心原则之上:

第一,阅读全文,而不是只看摘要

第二,检索真实文献:不依赖模型模糊记忆中的 “相关文献”,而是提取论文正文列出的参考文献,实时对接 OpenAlex、Crossref、Semantic Scholar三大数据库核验文献真实性,并调取文献原文,之后再开展论文评估;

第三,让多个AI评审在明确维度内评分

DNI会设置5至10个相互独立的AI评审,从四个维度评价一项研究。

第一个维度是独特性,主要判断论文提出的核心主张,与检索到的已有研究相比,原创程度如何。

第二个维度是挑战与替代程度,也就是论文在多大程度上对现有共识提出挑战,或者试图用一种新的解释框架取代既有观点。

第三个维度是综合性,关注论文是否实质性地连接了原本相对分离的学科、理论或研究传统。

第四个维度是连贯性。这一维度相当于一道基础门槛:如果论文自身的论证并不成立,前面几个维度的高分也就缺少意义。

在评估过程中,不同AI评审的权重并不完全相同,以避免某一个模型实例主导最终结果。如果评审之间出现较大分歧,系统也不会简单地把所有分数取平均,而是会自动启动第二组评审。

大语言模型不应该在没有边界的情况下自由判断一篇论文是否新颖。DNI允许模型在结构化框架中进行分析,但在模型之外,还设置了由程序执行的硬性规则,用来检查和修正输出。例如,系统设置了一个“综述上限”。如果一篇文章被识别为文献综述或综合性研究,那么无论AI评审给出多高的分数,其最终得分都不能超过0.45。

系统的早期测试暴露了一个非常典型的问题。我故意写了一篇虚假论文。文章中使用凭空捏造的计量单位,跨领域乱用物理学公式,完全没有实证数据。结果,系统将这篇论文评为“中度新颖”,得分达到0.70。看似逻辑通顺的虚假内容极易蒙蔽 AI 评审单元,因为它模仿了突破性成果的文本特征。每一个评审单元都按规则正常运行,只是这篇造假论文刚好能够同时满足所有评判条件。

为此,我在系统中加入了一道“真实性筛查”,重点检查研究是否具有实证基础,观点是否能够证伪。再次运行后,这篇虚假论文被系统标记,得分从0.70降至0.40,报告中还特别指出了其中使用的虚构计量单位。

在另一次测试中,我选取了同一位作者在五个月内发表的两篇相关论文。第一篇主要提出一个理论框架,第二篇则是后续的实证研究。两篇文章讨论的是同一个基础问题,但贡献形式并不相同。系统最终将第一篇论文识别为综合性研究,并按照规则将其得分限制在0.45;第二篇实证论文则被评为高度新颖,得分达到0.72。这一结果表明,预先设置的程序规则可以在没有人工干预的情况下,对不同类型的学术贡献作出一定区分。虽然多次运行下系统输出结果具备稳定性,但存在一个重大局限:结果尚未依托人类专家评判完成校准。将这套自动化评估结果和领域评审人的真实意见相互比对,是接下来最关键的验证工作。

DNI还不是一个成熟产品,也不能替代同行评议,更不应该被用来裁定一项研究的最终价值。现阶段它是一个数据与机理融合的AI试验平台,用来给论文作者和文献分析人员在投稿之前发现一些潜在问题:审稿人可能提出哪些质疑,论文结构是否存在缺口,某些重要主张是否缺少证据支持。对于科研资助机构,它还可能有另一种用途:评估那些旨在资助高风险研究和非常规研究的项目,最终是否真的支持了原本希望支持的工作。DNI提供的多维度评分,可以作为此类回顾性评估的一项参考,但不能成为唯一依据。由于系统还没有经过人类专家判断的校准,最重要的工作仍在后面。公开这个项目,并不是为了宣布AI已经能够识别科研创新,更不是为了宣称机器可以取代专家。真正的目的,是找到这种自动化推理在应用中什么情况下会失效。

我们近期启动了一次小规模的公开测试,希望进一步检验DNI系统的局限。使用者可以提交论文草稿或DOI,并获得一份完整的DNI评估报告。报告将列出各维度得分、不确定性区间,以及系统触发了哪些硬性分数上限或风险标记。如果系统错误地质疑了一种合理的非常规理论,或者遗漏了人类评审者一眼就能识别的问题,这不代表DNI系统失败。恰恰是这类反馈,能够帮助我们认清人工智能在科研评价领域的能力边界。

评论:科学“黄金时代”,亟需AI原生科研制度

AI能否有效甄别科研领域的“真创新”,表面是技术评价问题,深层是科研组织范式的系统性变革。

文章作者参加的英国元科学新颖性指标挑战赛,获胜者是德国于利希研究中心(Forschungszentrum Jülich)。他们的新颖性评估工具摆脱了传统依靠事后引用量评判成果的滞后模式,立足论文发表时点的学术语境,还原当期研究进展与知识缺口,通过研判研究是否提出新方法、破解长期难题、产出突破性结论,输出可解释的新颖性评分、误差区间与判定依据。该赛事以十万篇论文及领域专家匿名评分为基准,于利希方案的综合研判效果位居榜首。

上海市科学学研究所与浦江实验室合作研发的VIRSCI系统,则将探索重心前置至科研创意生成环节。平台依托多智能体虚拟科学家协同机制,自主完成课题研讨、文献梳理、方案迭代与交叉评议。系统将科研时序划分为过往知识积淀与未来发展趋势,要求优质创新既要与已有研究形成有效差异,也要贴合后续真实落地、具备学术影响力的研究方向。这一定义让科研新颖性跳出了浅层文本差异化的局限,成为衔接存量知识与未来科研趋势的动态价值标准。

两项成果分别锚定科研链条的创意前端与评价终端,共同印证AI赋能科研已迈入全新阶段。全球AI for Science的竞争逻辑已然迭代,不再局限于科研环节的效率提升,而是转向AI原生(AI Native)科研体系的全方位搭建与落地。

2026年7月,美国白宫发布《科学:一个新的黄金时代》报告,明确提出科研体系需围绕AI完成底层重构。当前主流的科研资助、学术出版与成果署名机制,均适配传统人类科研模式,难以适配人机协同的新型科研形态。报告提出,需构建更高效、更开放的学术发表机制,细化AI参与科研的贡献认定标准,革新科研资源配置逻辑,同时布局自动化实验室、AI验证基础设施、X-Labs等新型科研载体。

报告特别警示:AI大幅降低了知识生产成本,却未同步削减验证成本;若资助、发表、评价的制度改革持续滞后,单点科研效率的提升,无法转化为整体科学体系的实质性进步。由此可见,AI原生科研体系绝非简单的“科研+AI工具”,而是以AI为核心形成新的科研成果生产关系。科学的真正“黄金时代”,不会依托AI带来的论文数量红利到来。其核心依托,是一套与人机协同科研模式深度适配的全新制度体系:既能加速创新产出、精准甄别优质成果,也能包容非常规探索、有效过滤伪创新噪声,最终实现知识生产效率与科学体系自我纠错、迭代升级能力的双向提升。


文章作者:Carlos Enrique Arleo,英国Localis AI 负责人与核心研究员。翻译与评论:吴琪,上海市科学学研究所 科技与社会研究室副研究员。文章观点不代表主办机构立场。

◆ ◆ ◆

编辑邮箱:sciencepie@126.com

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
37℃以上高温让大脑“忘记燃脂”?一个颠覆外卖骑手认知的重磅研究:这种常见维生素竟是“解药”

37℃以上高温让大脑“忘记燃脂”?一个颠覆外卖骑手认知的重磅研究:这种常见维生素竟是“解药”

一节生姜
2026-07-27 20:26:37
明目张胆造假,中国电影还有救吗?

明目张胆造假,中国电影还有救吗?

闲人电影
2026-05-08 18:31:17
穆帅告知阿森西奥不在皇马计划中,这就是穆帅与安帅的不同之处

穆帅告知阿森西奥不在皇马计划中,这就是穆帅与安帅的不同之处

福酱的小时光
2026-07-28 06:54:03
被9亿债务压了4,年,董卿近况曝光!儿子一个举动,赢回她所有体面

被9亿债务压了4,年,董卿近况曝光!儿子一个举动,赢回她所有体面

赵昉是个热血青年
2026-07-27 17:04:00
心内科主任:心脏最危险信号,不是胸闷,而是频繁出现这6异常

心内科主任:心脏最危险信号,不是胸闷,而是频繁出现这6异常

展望云霄
2026-07-27 18:07:36
环球华裔小姐王艺凝,一出场便自带焦点,身姿气质惊艳全场

环球华裔小姐王艺凝,一出场便自带焦点,身姿气质惊艳全场

娱你同欢
2026-07-03 22:20:06
中国和塔吉克斯坦没有深仇大恨,为何两国边界却一直是未定国界?

中国和塔吉克斯坦没有深仇大恨,为何两国边界却一直是未定国界?

抽象派大师
2026-05-25 15:36:18
血脂与馒头的关系,医生:若想保护血管健康,要减少吃这5种食品

血脂与馒头的关系,医生:若想保护血管健康,要减少吃这5种食品

健康之光
2026-07-28 15:10:10
离奇!机场同事相识两年成好友,一次闲聊才发现:两人竟是失散多年的亲兄妹

离奇!机场同事相识两年成好友,一次闲聊才发现:两人竟是失散多年的亲兄妹

华人生活网
2026-07-26 04:01:37
大姨卖车供我上清华,如今我年薪600万,大姨来借钱,我回了6个字

大姨卖车供我上清华,如今我年薪600万,大姨来借钱,我回了6个字

麦子情感故事
2026-07-28 16:57:29
U23国足闹大了!37岁高龄国脚加盟震惊亚洲,足协惧怕死亡之组?

U23国足闹大了!37岁高龄国脚加盟震惊亚洲,足协惧怕死亡之组?

广西阿妹香香
2026-07-28 08:37:46
春妮周末时光:丝袜美腿吸睛,腹有诗书才是顶级诱惑!

春妮周末时光:丝袜美腿吸睛,腹有诗书才是顶级诱惑!

可乐谈情感
2026-07-29 00:32:13
别人都劝我选Model Y,我提了iX3,一年半后差距很明显

别人都劝我选Model Y,我提了iX3,一年半后差距很明显

娱乐圈的笔娱君
2026-07-28 05:43:45
周星驰新片上演奇迹逆跌!票房触底反弹,市场预估冲击30亿

周星驰新片上演奇迹逆跌!票房触底反弹,市场预估冲击30亿

陈意小可爱
2026-07-28 08:38:55
最牛美女处长,1000天和男上司开房410次,临时工晋升财务副处长

最牛美女处长,1000天和男上司开房410次,临时工晋升财务副处长

三石记
2026-06-26 07:16:19
CNN顶梁柱回应特朗普晚宴当面羞辱:“重点根本不在我身上”

CNN顶梁柱回应特朗普晚宴当面羞辱:“重点根本不在我身上”

自愈小日子
2026-07-29 00:46:22
伊朗没倒下,日本倒先撑不住了?日专家喊话美国:是中国在搞鬼!

伊朗没倒下,日本倒先撑不住了?日专家喊话美国:是中国在搞鬼!

乌克兰小静
2026-07-29 01:37:40
2027年NBA选秀提前看:这10名大学生返校后,首轮前景飙升

2027年NBA选秀提前看:这10名大学生返校后,首轮前景飙升

甜份超标的我
2026-07-28 02:00:04
美股AI硬件板块跌幅继续扩大,美光、AMD、闪迪等多股跌超10%

美股AI硬件板块跌幅继续扩大,美光、AMD、闪迪等多股跌超10%

界面新闻
2026-07-28 22:18:49
要变天!伊朗对乌“宣战”后,不到24小时,叙利亚和以色列联手了

要变天!伊朗对乌“宣战”后,不到24小时,叙利亚和以色列联手了

墨子翟的日记y
2026-07-28 14:27:16
2026-07-29 03:16:49
三思派
三思派
专注科技创新的新媒体
2550文章数 3582关注度
往期回顾 全部

科技要闻

Kimi K3开放权重,想本地部署,200万元起

头条要闻

博主"听泉赏宝"炒股亏光父母积蓄遭拉黑 称"再玩剁手"

头条要闻

博主"听泉赏宝"炒股亏光父母积蓄遭拉黑 称"再玩剁手"

体育要闻

35岁德甲球星,退役半年后成了一名农民

娱乐要闻

43岁演员王凯去世!独居公寓无人知晓

财经要闻

潘老板的算盘全砸了,欠的25亿跑不了了

汽车要闻

宾利托卡尔重塑百年菱形美学,将于9月全球首秀

态度原创

家居
本地
健康
公开课
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

跟着影视去旅行:八仙篇

中风急救吃安宫牛黄丸?千万别乱喂

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

特朗普:若谈判破裂将强力打击伊朗

无障碍浏览 进入关怀版