网易首页 > 网易号 > 正文 申请入驻

ICML 2026 | InnoEval:科研idea的多视角评估

0
分享至


论文题目:
InnoEval: On Research Idea Evaluation as a Knowledge-Grounded, Multi-Perspective Reasoning Problem

论文链接:
https://arxiv.org/abs/2602.14367

代码链接:
https://github.com/zjunlp/InnoEval


一、引言

大语言模型正在把科研创意的生产速度推向一个新的量级:文献调研智能体可以寻找研究空白,创意生成智能体可以批量提出假设,自动科学家甚至能够继续完成实验和论文写作。然而,创意生成的“爆炸”并没有伴随同等规模的评估能力增长。一个看似新颖的想法可能早已被相邻领域验证,一套漂亮的方法也可能建立在不现实的假设之上。若不能尽早识别这些问题,后续的实现、实验与写作只会放大时间和算力成本。

目前的科研创意评估主要面临三项挑战:

1.知识视野狭窄:只检索静态论文容易忽略网页讨论、工程实践和开源代码等“活知识”,也难以判断一个创意在特定时间点是否真正新颖;

2.评审共识缺失:直接使用单个LLM-as-a-Judge,会把模型本身的偏好固化为评审标准,难以模拟真实同行评议中不同专家的独立判断与意见汇合;

3.评价维度扁平:用一个总分压缩创意的全部特征,会掩盖新颖性、可行性、有效性等维度之间的张力,也无法给研究者提供可操作的修改建议。

基于此,本文将科研创意评估重新定义为一个知识增强的多视角推理问题,并提出深度创新评估框架 InnoEval。它不是让一个大模型“多想几次”,而是先从论文、网页与代码仓库中寻找证据,再组织具有不同学术背景的“创新评审委员会”,从清晰度、新颖性、有效性、可行性和重要性五个维度独立评议,最终形成带证据、分数、元评审结论和修改建议的完整报告。

二、方法

InnoEval的完整流程可以概括为四个环节:结构化创意、异构深度检索、证据对齐和多视角评估。


2.1 将任意形态的创意整理为结构化表示

研究者可以输入一句初步假设,也可以输入一份接近完整论文的成熟方案。抽取智能体首先将原始文本拆分为六个部分:简短总结、研究动机、研究问题、研究方法、实验设置和预期结果,其中简短总结、实验设置与预期结果可以缺省。系统还为每个创意引入时间戳,使“是否新颖”始终在指定时间截面上判断,而不是用今天的知识反向否定过去的创新。

2.2 从论文、网页和代码中执行异构深度检索

InnoEval为创意的不同组成部分、不同搜索工具分别生成查询,并通过同义表达扩展提升召回率。检索源不仅包括arXiv、Semantic Scholar和Google Scholar等文献平台,还包括Google网页搜索、GitHub与Kaggle,从而覆盖理论、社区观点和工程实现三类知识。

检索采用“快—慢”结合的策略。快速检索先获得摘要、网页快照和仓库简介;随后系统综合语义相关性与LLM给出的质量判断进行排序和过滤。语义分数可以保证主题匹配,LLM分数则进一步考虑论文引用量、发表 venue、网站热度和仓库star数等质量信号。对筛出的高价值结果,慢速检索会阅读论文全文、总结网页内容,并结合README、核心代码和调用关系分析代码仓库。系统还会根据当前结果改写过窄、过宽或不相关的查询,迭代搜索最多三轮。

一个很有意思的设计是,系统会区分时间戳之前和之后的知识:前序知识用于评价创意,后序知识用于提出修改建议。这样既避免了“用未来知识审判过去”,又能利用后续工作帮助研究者改进方案。

2.3 将检索结果细粒度对齐到创意证据

相关并不等于有用。InnoEval进一步使用证据对齐智能体,从每份知识报告中抽取真正支持或反驳某个创意组件的片段,并解释它与研究动机、问题、方法或实验之间的具体联系。相比把大量搜索结果直接塞给评审模型,这一步能够过滤噪声,让后续判断建立在更明确的证据链上。

2.4 用“评审委员会”完成五维解耦评价

InnoEval构建了一个学术人格池。每个评审人格都包含学术背景、对论文/网页/代码知识的熟悉程度以及评审偏好。系统会按照熟悉程度遮蔽一部分知识,以模拟真实专家有限而不同的认知边界;随后为每个创意随机选择五名评审者,而不是让同一个模型重复采样五次。

在每个评审视角下,五个专门的评价智能体分别对清晰度、有效性、新颖性、可行性和重要性给出0—10分与详细理由,用户也可以注册新的自定义维度。最后,报告智能体综合所有检索证据和评审意见,生成元评审、最终分数、Reject/Poster/Spotlight/Oral决策以及具体修改建议。对于多个创意,InnoEval还可以比较各维度的优劣并输出完整排序。

三、实验

为了覆盖真实科研中的不同使用方式,本文从ICLR 2025和NeurIPS 2025的OpenReview投稿中构建了三类评测数据:

•单点评估(Point-wise):包含217个经人工校正的创意,其中138个Reject、66个Poster、9个Spotlight、4个Oral,用于判断“拒稿/接收”或“拒稿/Poster/Highlight”;

•成对比较(Pair-wise):包含372对创意,其中172对标签差距较大的简单样本和200对标签相邻的困难样本,用于选择更好的创意;

•分组排序(Group-wise):包含172组主题相近的创意,用于选出组内最佳方案并恢复完整排名。

所有方法统一使用DeepSeek-V3.2作为骨干模型,比较对象包括CoT、RAG、ResearchAgent、InternAgent以及专门的创意评估方法GraphEval和ScholarEval。


定量结果显示,InnoEval在单点、成对和分组三种评估任务的所有指标上均取得最佳表现。论文还观察到,多数基线会出现明显的标签坍缩:模型倾向于只预测一两个类别,因此宏平均F1显著低于准确率。InnoEval借助证据支撑、维度拆分和多视角讨论,使预测更均衡,三分类F1甚至略高于准确率。


除了预测最终决策,评估报告是否真正“有用”也很重要。本文使用o4-mini从合理性、证据支持度、分析深度、建议建设性和整体质量五个方面比较报告。在与所有基线的对比中,InnoEval的整体质量胜率均超过 70%;相较多数方法,其分析深度胜率超过 90%,修改建议的建设性胜率超过 80%。这说明异构知识与多维评审带来的收益不仅体现在标签上,也体现在评语的证据性和可操作性上。


在人类评价中,作者邀请5位AI领域专家对随机抽取的60个创意进行五维打分,并进一步从真实OpenReview评语中抽取对应维度的评分。InnoEval与人类专家、真实评审在全部五个维度上的Pearson相关系数均不低于 0.5。


消融实验进一步验证了各模块的作用。移除证据对齐会在三类任务上造成稳定下降,说明检索到知识之后仍需要过滤噪声并建立细粒度联系;关闭学术人格、退化为直接LLM-as-a-Judge,会在单点评估和分组排序上带来尤其明显的损失;只检索论文而移除网页与代码,也会使成对和分组任务显著下降,表明比较多个相近创意时,比评价单个创意更依赖丰富的背景知识。将骨干模型替换为o4-mini后,InnoEval仍能超过最强基线,说明收益并不局限于单一模型。

四、分析 4.1 真正有效的测试时扩展来自“多元共识”


随着采样次数增加,不带人格和带人格的评估都会变好,但普通Test-Time Scaling很快趋于饱和,而引入不同学术人格后的曲线仍持续上升。原因在于,前者只是迫使同一个裁判生成不同说法,后者才是在模拟不同背景专家独立审阅后形成共识。一个颇具启发性的现象是:在分组排序中,只使用一个人格甚至不如完全不使用人格——这只是把模型原有偏见替换成某个特定评审者的偏见。论文最终选用5名评审者,是效果与推理成本之间的折中,而不是能力上限。

4.2 高质量检索不能只有“相关”,还要兼顾覆盖与多样性


在相关密度、主题覆盖、多样性和资源质量四项检索指标上,InnoEval取得了更均衡的结果。ScholarEval虽然能找到高度相关的论文,但检索结果容易收敛到相似内容,牺牲主题覆盖和多样性;面向综述生成的AutoSurvey则更重视广泛召回,却无法保证每条证据都紧密服务于创意评价。InnoEval的异构检索恰好补足了“只查论文”的盲区。

4.3 好的评价可以反过来改善创意生成


作者把不同评价方法生成的反馈接入ResearchAgent的创意迭代流程。InnoEval的建议能够同时改善问题定义、方法设计和实验方案,说明评估系统不仅可以“打分”,还可以成为创意优化器。相比之下,只关注贡献和正确性的ScholarEval会引导创意进行偏科式优化,反而降低最终生成质量。

4.4 决定“能否接收”和“能否成为亮点”的因素并不相同


回归分析显示,新颖性是决定一个创意能否跨过接收门槛的最关键因素,有效性、重要性和可行性也具有明显影响,而清晰度相对较弱。但当问题从“能否接收”变为“能否从Poster升级为Highlight”时,可行性的重要程度显著上升,其余维度也都需要保持较强水平。换言之,一个突出创意既要足够新,也要能够被完整而可信的实验真正验证。


五个维度之间的关系也呈现出与科研直觉一致的模式:重要性与新颖性、有效性分别具有较强正相关;有效性与可行性也明显正相关,理论上站得住脚的想法通常更容易通过实验验证。与此同时,新颖性与有效性、可行性呈轻微负相关,反映了真正创新的方案往往更难获得既有理论支持,也更难通过标准实验确认。InnoEval捕捉到的不是简单的“好创意各项都高”,而是科研评审中真实存在的维度张力。

五、结论

本文提出 InnoEval,将科研创意评估从单一LLM打分重构为一个由动态知识、证据对齐、多维指标和多背景评审共同驱动的推理过程。系统从论文、网页和代码中寻找“活知识”,让不同学术人格独立评审,并最终生成带引用证据、细粒度分数、元评审决策和修改建议的完整报告。在单点判断、成对比较和分组排序三类真实投稿数据上,InnoEval均显著优于现有方法,其评分模式也与人类专家和真实同行评议保持较高一致性。

这项工作的价值并不只是做出一个更强的“AI审稿人”,而是展示了自动科研中一个容易被忽略的方向:当创意生成越来越便宜时,可信的创意筛选、比较和迭代将成为新的核心瓶颈。

当然,InnoEval目前仍主要面向AI领域和文本形式的创意,单个样本的完整评估约需半小时,系统也无法彻底消除检索错误、模型幻觉和评审偏见。论文因此明确主张人机协同:让InnoEval扩展专家的知识视野、暴露潜在风险并提供第二意见,而不是用自动评分替代最终的学术判断。未来值得探索的方向包括跨学科评估、多模态创意输入、更高效的深度检索,以及让人类评审与AI委员会在真实科研流程中形成可追踪、可校正的协作闭环。

Illustration From IconScout By IconScout Store

9月28日晚@美国匹兹堡

「IROS 2026 群星闪耀 精英晚宴」

免费报名,期待线下见面!

北京时间9月25日(周五) 12:00截止报名

-The End-

本周上新!

扫码观看!

“AI技术流”原创投稿计划

TechBeat是由将门创投建立的AI学习社区(www.techbeat.net)。社区上线700+期talk视频,3000+篇技术干货文章,方向覆盖CV/NLP/ML/Robotis等;每月定期举办顶会及其他线上交流活动,不定期举办技术人线下聚会交流活动。我们正在努力成为AI人才喜爱的高质量、知识型交流平台,希望为AI人才打造更专业的服务和体验,加速并陪伴其成长。

投稿内容

// 最新技术解读/系统性知识分享 //

// 前沿资讯解说/心得经历讲述 //

投稿须知

稿件需要为原创文章,并标明作者信息。

我们会选择部分在深度技术解析及科研心得方向,对用户启发更大的文章,做原创性内容奖励

投稿方式

发送邮件到

yimingzhang@thejiangmen.com

或添加工作人员微信(aceyiming)投稿,沟通投稿详情

关于我“门”

将门是一家以专注于数智核心科技领域的新型创投机构,也是北京市标杆型孵化器。 公司致力于通过连接技术与商业,发掘和培育具有全球影响力的科技创新企业,推动企业创新发展与产业升级。

将门成立于2015年底,创始团队由微软创投在中国的创始团队原班人马构建而成,曾为微软优选和深度孵化了126家创新的技术型创业公司。

如果您是技术领域的初创企业,不仅想获得投资,还希望获得一系列持续性、有价值的投后服务,欢迎发送或者推荐项目给我“门”:

bp@thejiangmen.com


点击右上角,把文章分享到朋友圈

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
莫言:和周围人搞好关系的秘诀——不分享喜悦、不炫耀成功、不说三道四、不假装聪明

莫言:和周围人搞好关系的秘诀——不分享喜悦、不炫耀成功、不说三道四、不假装聪明

杏花烟雨江南的碧园
2026-08-15 13:15:03
傅园慧现状:成为浙大老师,对感情不将就,30岁不缺钱享受生活

傅园慧现状:成为浙大老师,对感情不将就,30岁不缺钱享受生活

大西体育
2026-09-30 23:33:03
“鸡娃不如鸡己”!一张清华录取通知书,一栋6500万西三环别墅:两代人的时代际遇,掀起阶层话题热议

“鸡娃不如鸡己”!一张清华录取通知书,一栋6500万西三环别墅:两代人的时代际遇,掀起阶层话题热议

火山詩话
2026-10-01 05:59:30
医美是个无底洞,这次金鹰节“变样”的杨紫,印证了宋丹丹的话

医美是个无底洞,这次金鹰节“变样”的杨紫,印证了宋丹丹的话

谢葅解说
2026-10-01 05:56:58
南华寺百岁高僧:人死后基本都投身畜生道,活人进入轮回永不超生

南华寺百岁高僧:人死后基本都投身畜生道,活人进入轮回永不超生

纸鸢奇谭
2025-01-17 14:30:03
延迟退休实施一年多,一个尴尬的问题浮出水面,六十五岁才退休,三十五岁找不到工作了

延迟退休实施一年多,一个尴尬的问题浮出水面,六十五岁才退休,三十五岁找不到工作了

民生格物
2026-09-29 13:08:09
他们是陈妤颉父母,都是浙大体育特长生,父亲国家一级运动员

他们是陈妤颉父母,都是浙大体育特长生,父亲国家一级运动员

娱说瑜悦
2026-09-27 22:41:01
外挂相机?华为这步棋,把整个行业都打懵了,是进步还是倒退?

外挂相机?华为这步棋,把整个行业都打懵了,是进步还是倒退?

大卫聊科技
2026-09-30 13:18:16
广东汕头43岁男子用土豆当主食,1个月花300元,半年瘦了25斤,脂肪肝没了,血压、血糖稳了:这应该是最便宜的减肥法了

广东汕头43岁男子用土豆当主食,1个月花300元,半年瘦了25斤,脂肪肝没了,血压、血糖稳了:这应该是最便宜的减肥法了

扬子晚报
2026-09-30 12:32:17
中网中国德比收获满满!施晗展现特点超常发挥,郑钦文以赛代练!

中网中国德比收获满满!施晗展现特点超常发挥,郑钦文以赛代练!

篮球资讯达人
2026-10-01 14:33:10
北理工极速解聘裴轶,真正原因是什么?

北理工极速解聘裴轶,真正原因是什么?

梳子姐
2026-09-30 16:58:56
做饭时只放生抽不放盐,大半年后去做体检,检查结果让医生意外

做饭时只放生抽不放盐,大半年后去做体检,检查结果让医生意外

医学原创故事会
2026-09-29 23:58:03
妙瓦底电诈园区发布招聘信息超9300则 开始针对美国、欧盟国家

妙瓦底电诈园区发布招聘信息超9300则 开始针对美国、欧盟国家

闪电新闻
2026-09-30 19:18:07
中方舰群抵近马尼拉湾后!菲律宾外交部回应了,来了一出嘴硬腿软

中方舰群抵近马尼拉湾后!菲律宾外交部回应了,来了一出嘴硬腿软

元宝课堂
2026-09-28 17:01:10
吹牛老爹爆坐牢爽当VIP!「用手机看前女友清凉照」 买通囚犯当佣人

吹牛老爹爆坐牢爽当VIP!「用手机看前女友清凉照」 买通囚犯当佣人

ETtoday星光云
2026-10-01 13:43:03
男人过了五十五岁打死也不能做下面这六件事:1.千万不要出轨

男人过了五十五岁打死也不能做下面这六件事:1.千万不要出轨

艺鉴在线
2026-09-30 09:29:39
坐牢3年罚款10万,被毁掉7年青春的陈昱霖,出狱后过得怎么样了?

坐牢3年罚款10万,被毁掉7年青春的陈昱霖,出狱后过得怎么样了?

悦君兮君不知
2026-09-30 04:09:10
奚梦瑶穿裙褂晒四太送的豪礼:脖子双手挂满22只龙凤镯,网友算完账惊了:近300万

奚梦瑶穿裙褂晒四太送的豪礼:脖子双手挂满22只龙凤镯,网友算完账惊了:近300万

八卦宝宝
2026-10-01 04:17:32
iPhone18Pro国内销量炸了,卖这么好,简直没天理

iPhone18Pro国内销量炸了,卖这么好,简直没天理

科技头版Pro
2026-09-29 14:31:30
比同济医院还牛的医院,在武汉悄悄出现了

比同济医院还牛的医院,在武汉悄悄出现了

华庭讲美食
2026-10-01 10:21:08
2026-10-01 15:59:00
将门创投 incentive-icons
将门创投
加速及投资技术驱动型初创企业
2504文章数 596关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

鲁比奥要求伊朗代表团立即离境 伊外长凌晨登上飞机

头条要闻

鲁比奥要求伊朗代表团立即离境 伊外长凌晨登上飞机

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

宋佳二封金鹰视后 内娱奖项史即将改写

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

家居
数码
房产
健康
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

把键盘做成传送带,谷歌Gboard日本团队一年一度的整活来了

房产要闻

4000+/平!华侨城,直接把海口楼市的地板给掀了!

刷酸祛痘,为什么有人翻车?

军事要闻

美防长宣布组建“自主作战司令部”

无障碍浏览 进入关怀版