网易首页 > 网易号 > 正文 申请入驻

ACL 2026 Oral|RPC-Bench:从审稿问答出发,评测大模型的论文理解能力

0
分享至


读完一篇论文,不等于理解一篇论文。

能总结摘要,也不等于能回答围绕方法设计、实验结果和结论依据的具体问题。

科研场景里的论文阅读,通常不是只问“这篇文章讲了什么”。更常见的问题是:

  • 这个方法为什么这样设计?
  • 和已有方法相比,差异到底在哪里?
  • 实验设置是否足以支撑结论?
  • 表格里的结果说明了什么?
  • 作者提出的 claim,是否真的能从论文证据中得到支持?

RPC-Bench关注的正是这类能力:模型能否充分理解论文内容并给出可靠回答。不同于直接用大语言模型(LLM)从正文合成问题,RPC-Bench从真实review-rebuttal互动中构造QA。审稿人与作者围绕论文贡献、问题和证据链展开讨论,这些内容更贴近科研人员实际关心的论文理解问题。


论文: https://arxiv.org/abs/2601.14289

GitHub: https://github.com/zai-org/RPC-Bench

项目主页: https://rpc-bench.github.io/

HF dataset: https://huggingface.co/datasets/zai-org/RPC-Bench

RPC-Bench做了什么?

RPC-Bench是一个面向研究论文理解的问答基准,主要覆盖计算机科学论文,支持文本输入和PDF页面图像输入两种形式,可用于评测LLM、VLM、文档理解模型和RAG方法等。

从数据规模看,RPC-Bench最终包含4150篇论文和61.3K个QA。其中开发集和测试集经过人工验证,用于更稳定地评估模型表现;训练集则作为补充数据,供研究人员根据具体实验目标选择使用。


RPC-Bench的论文主要来自OpenReview,因此领域分布以AI和计算机科学子领域为主,包括ML Theory、CV、NLP、RL、Optimization、Generative Models等方向。


相比已有研究论文/文档问答基准,RPC-Bench的特点在于:真实review-rebuttal来源、内容导向的细粒度taxonomy、多维度回答质量评估,并同时支持文本与页面图像输入。


RPC-Bench是怎么构建的?


RPC-Bench的构建流程包括四个环节:

  1. 1. 数据收集与筛选 :从OpenReview收集2013-2024年的论文、review、rebuttal和元数据,并结合AMiner引用信息进行质量筛选和影响力感知采样。

  2. 2. 拆解审稿互动 :使用GPT-4o将长review/rebuttal拆分为更小的comment-response单元,使每个单元尽量聚焦一个问题或澄清点。

  3. 3. 改写为标准QA :使用GLM-4-Plus和DeepSeek-V3将comment-response单元改写为可独立理解的问题与答案,并分配taxonomy标签。

  4. 4. 过滤与人工复核 :过滤编辑性问题、外部资源依赖和空泛承诺;开发集和测试集进一步人工复核,确保问题可回答、答案有依据、分类合理。

这种LLM-human collaborative annotation的设计,一方面利用模型降低大规模构建成本,另一方面通过人工复核控制开发集和测试集质量。

论文理解被拆成哪些能力?

RPC-Bench设计了一个对齐科学研究流程的细粒度taxonomy,用于考察模型在学术语境中回答what、how、why问题的能力:从理解概念与背景,到理解方法和实验如何运作,再到解释设计动机、结果原因和结论依据。


这套分类大致对应科研阅读中的几类核心能力:

  • what层面 :模型需要解释概念、术语、图表信息和实验结果本身,回答“论文说了什么”;

  • how层面 :模型需要理解方法流程、模块机制、实验设置和评测协议,回答“论文是如何做的”;

  • why层面 :模型需要分析设计动机、实验现象、方法差异和结论边界,回答“为什么这样做、为什么得到这样的结果”;

  • claim verification层面 :模型需要判断具体科学主张是否能从论文证据中得到支持。

这样的设计让RPC-Bench不只评估摘要或事实定位能力,而是把“读懂论文”拆成可观察、可诊断的多个能力维度。

怎么评测:不只看答案像不像

开放式论文问答中,答案和参考答案“长得像”不一定代表答得对。因此,RPC-Bench没有只依赖ROUGE、BERTScore等表面相似度指标,而是采用LLM-as-a-Judge的方式,从三个维度评估开放式回答:

  • Correctness:回答内容是否正确、是否忠实于论文(类似precision);
  • Completeness:是否覆盖参考答案中的关键信息(类似recall);
  • Conciseness:是否简洁,是否避免无关扩展(控制冗余和跑题)。

论文进一步用correctness和completeness的调和均值得到F1-like,再结合conciseness得到Informativeness。对于Claim Verification,则使用accuracy进行评价。


这套指标的出发点比较直接:科研问答既不能答错,也不能漏答,还不能用大量无关内容掩盖关键信息。

在评估配置上,论文通过人工一致性实验校准LLM-as-a-Judge设置,最终采用加入标题和摘要、分维度评估、decimal scoring的配置,并选择GPT-5与Gemini-3-Pro作为主实验的评估模型组合。



实验结果说明了什么?

论文评测了28个模型,包括LLM、Document-Centric Model、VLM和RAG方法:



从这些结果中,可以观察到:

  • 强模型仍有明显提升空间。GPT-5的F1-like为68.20,但加入简洁性约束后的Informativeness为37.46。
  • 页面图像输入并不天然优于文本输入。当前VLM在长篇论文、图表、公式和跨页信息整合上仍然不稳定。
  • RAG不是自动解法。检索片段不完整,或生成阶段不能整合方法与实验逻辑,都会导致错误或遗漏。
  • 传统字符串指标信号有限。答案“看起来相似”不等于真正正确、完整。

论文还通过case study总结了常见失败模式,包括退化重复输出、多模态证据利用不足、错误否认论文中已有信息,以及True/False等精确输出格式不合规。


当然,RPC-Bench也有清晰边界。它当前主要覆盖计算机科学领域,数据来自OpenReview,任务重点是单篇论文理解。跨论文综述、跨领域迁移、多轮科研讨论、真实代码复现和实验验证等能力,还需要进一步的评测设计。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
李小璐带三岁女孩回家,被曝早已生下二胎女儿,原来她一直在低调幸福中?

李小璐带三岁女孩回家,被曝早已生下二胎女儿,原来她一直在低调幸福中?

一盅情怀
2026-07-26 18:29:41
决裂!38岁本泽马被沙特豪门勒令离队 强硬回应:先给我把工资结清

决裂!38岁本泽马被沙特豪门勒令离队 强硬回应:先给我把工资结清

风过乡
2026-07-27 08:01:23
国务院第840号令动真格了!3900万退役军人终于等到这一天

国务院第840号令动真格了!3900万退役军人终于等到这一天

音乐时光的娱乐
2026-07-26 19:21:44
画面不堪入目!百万粉丝女网红及经纪人,双双被捕,警方披露详情

画面不堪入目!百万粉丝女网红及经纪人,双双被捕,警方披露详情

齐鲁壹点
2026-07-27 13:51:37
菲尔兹奖揭晓,纽约大学为何全校庆祝王虹

菲尔兹奖揭晓,纽约大学为何全校庆祝王虹

王姐懒人家常菜
2026-07-28 05:22:23
谢贤丧事后,张柏芝送儿子澳洲上学,19岁lucas临别拥抱妈妈孝顺

谢贤丧事后,张柏芝送儿子澳洲上学,19岁lucas临别拥抱妈妈孝顺

椰黄娱乐
2026-07-26 11:49:03
别被群消息骗了!2026养老金22连涨已成定局,但“涨法”彻底变了

别被群消息骗了!2026养老金22连涨已成定局,但“涨法”彻底变了

麓谷隐士
2026-07-27 06:10:03
1千克就能致命,曾经却被当成主粮食用,为何如今还在大量种植?

1千克就能致命,曾经却被当成主粮食用,为何如今还在大量种植?

王鶔吃吃喝喝
2026-07-27 21:30:51
今日开通!东莞将拥有两大机场!

今日开通!东莞将拥有两大机场!

东莞好生活
2026-07-28 00:04:05
王菲团队下场反击,谢霆锋一纸声明护妻,没给张柏芝留一丝体面

王菲团队下场反击,谢霆锋一纸声明护妻,没给张柏芝留一丝体面

阿策聊实事
2026-07-26 21:48:58
叫豹不是豹,叫虎不是虎,美洲豹到底是个啥玩意儿?

叫豹不是豹,叫虎不是虎,美洲豹到底是个啥玩意儿?

向航说
2026-07-27 12:23:46
《百年孤独》:停止喂养任何人,你连想改变别人的念头都不要有,猫有猫道鼠有鼠道,蛇暖不热狼喂不熟,要把有限的能量全部用来滋养自己

《百年孤独》:停止喂养任何人,你连想改变别人的念头都不要有,猫有猫道鼠有鼠道,蛇暖不热狼喂不熟,要把有限的能量全部用来滋养自己

心理观察局
2026-07-28 06:37:13
全美热搜第一!詹姆斯加盟费城组超级四巨 76人夺冠概率升联盟第三

全美热搜第一!詹姆斯加盟费城组超级四巨 76人夺冠概率升联盟第三

艳姐的搞笑视频
2026-07-28 08:59:00
女子游内蒙古感叹200元一晚的客房自带衣帽间,卫生间大到“可以跑步”,酒店前台:房间面积68平方米,目前旺季涨了数十元

女子游内蒙古感叹200元一晚的客房自带衣帽间,卫生间大到“可以跑步”,酒店前台:房间面积68平方米,目前旺季涨了数十元

扬子晚报
2026-07-26 16:14:27
国产超强1TB SSD卖999元!和国际大厂几乎同价

国产超强1TB SSD卖999元!和国际大厂几乎同价

游民星空
2026-07-27 16:52:40
金熙英住豪宅穿名牌,却被崔泰源说成:她不是图我的钱

金熙英住豪宅穿名牌,却被崔泰源说成:她不是图我的钱

喜欢历史的阿繁
2026-07-28 05:29:43
相恋16年,名模罕见晒游艇恩爱合照为59岁硬汉庆生

相恋16年,名模罕见晒游艇恩爱合照为59岁硬汉庆生

热搜摘要官
2026-07-28 01:46:49
女人想让你“泡”不会直说,但会给你6个暗示,90%男人都错过了

女人想让你“泡”不会直说,但会给你6个暗示,90%男人都错过了

艺鉴在线
2026-07-28 08:38:31
曝西乙队有意签19岁王钰栋!球员回应未来打算,留洋年薪缩水10倍

曝西乙队有意签19岁王钰栋!球员回应未来打算,留洋年薪缩水10倍

侃球熊弟
2026-07-28 00:40:03
深圳新鹏城三连败!体育总监遭炮轰:被小丑毁掉,不懂球的门外汉

深圳新鹏城三连败!体育总监遭炮轰:被小丑毁掉,不懂球的门外汉

奥拜尔
2026-07-27 13:32:40
2026-07-28 09:44:49
学术头条
学术头条
致力于学术传播和科学普及,重点关注AI4Science、大模型等前沿科学进展。
1458文章数 5081关注度
往期回顾 全部

科技要闻

Kimi K3完整开放!2.78万亿参数模型可部署

头条要闻

媒体:外交部三度重申"没有交流" 看来日本有人在扯谎

头条要闻

媒体:外交部三度重申"没有交流" 看来日本有人在扯谎

体育要闻

说过不会再回NBA的男人,又回来了

娱乐要闻

李登科向李宏毅道歉 称给他道歉不丢人

财经要闻

悟空租车乱象追踪:货不对板与迟来的赔偿

汽车要闻

2026宝马摩托车文化节举行 三款新车上市

态度原创

艺术
亲子
时尚
家居
公开课

艺术要闻

无锡不大,但真的很美

亲子要闻

法国知名托幼暴雷,老师竟对孩子说:你将来会做小偷!

地表最强“小个子穿搭教科书”,结婚了!

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版