![]()
论文题目:
InnoEval: On Research Idea Evaluation as a Knowledge-Grounded, Multi-Perspective Reasoning Problem
论文链接:
https://arxiv.org/abs/2602.14367
代码链接:
https://github.com/zjunlp/InnoEval
一、引言
大语言模型正在把科研创意的生产速度推向一个新的量级:文献调研智能体可以寻找研究空白,创意生成智能体可以批量提出假设,自动科学家甚至能够继续完成实验和论文写作。然而,创意生成的“爆炸”并没有伴随同等规模的评估能力增长。一个看似新颖的想法可能早已被相邻领域验证,一套漂亮的方法也可能建立在不现实的假设之上。若不能尽早识别这些问题,后续的实现、实验与写作只会放大时间和算力成本。
目前的科研创意评估主要面临三项挑战:
1.知识视野狭窄:只检索静态论文容易忽略网页讨论、工程实践和开源代码等“活知识”,也难以判断一个创意在特定时间点是否真正新颖;
2.评审共识缺失:直接使用单个LLM-as-a-Judge,会把模型本身的偏好固化为评审标准,难以模拟真实同行评议中不同专家的独立判断与意见汇合;
3.评价维度扁平:用一个总分压缩创意的全部特征,会掩盖新颖性、可行性、有效性等维度之间的张力,也无法给研究者提供可操作的修改建议。
基于此,本文将科研创意评估重新定义为一个知识增强的多视角推理问题,并提出深度创新评估框架 InnoEval。它不是让一个大模型“多想几次”,而是先从论文、网页与代码仓库中寻找证据,再组织具有不同学术背景的“创新评审委员会”,从清晰度、新颖性、有效性、可行性和重要性五个维度独立评议,最终形成带证据、分数、元评审结论和修改建议的完整报告。
二、方法
InnoEval的完整流程可以概括为四个环节:结构化创意、异构深度检索、证据对齐和多视角评估。
![]()
2.1 将任意形态的创意整理为结构化表示
研究者可以输入一句初步假设,也可以输入一份接近完整论文的成熟方案。抽取智能体首先将原始文本拆分为六个部分:简短总结、研究动机、研究问题、研究方法、实验设置和预期结果,其中简短总结、实验设置与预期结果可以缺省。系统还为每个创意引入时间戳,使“是否新颖”始终在指定时间截面上判断,而不是用今天的知识反向否定过去的创新。
2.2 从论文、网页和代码中执行异构深度检索
InnoEval为创意的不同组成部分、不同搜索工具分别生成查询,并通过同义表达扩展提升召回率。检索源不仅包括arXiv、Semantic Scholar和Google Scholar等文献平台,还包括Google网页搜索、GitHub与Kaggle,从而覆盖理论、社区观点和工程实现三类知识。
检索采用“快—慢”结合的策略。快速检索先获得摘要、网页快照和仓库简介;随后系统综合语义相关性与LLM给出的质量判断进行排序和过滤。语义分数可以保证主题匹配,LLM分数则进一步考虑论文引用量、发表 venue、网站热度和仓库star数等质量信号。对筛出的高价值结果,慢速检索会阅读论文全文、总结网页内容,并结合README、核心代码和调用关系分析代码仓库。系统还会根据当前结果改写过窄、过宽或不相关的查询,迭代搜索最多三轮。
一个很有意思的设计是,系统会区分时间戳之前和之后的知识:前序知识用于评价创意,后序知识用于提出修改建议。这样既避免了“用未来知识审判过去”,又能利用后续工作帮助研究者改进方案。
2.3 将检索结果细粒度对齐到创意证据
相关并不等于有用。InnoEval进一步使用证据对齐智能体,从每份知识报告中抽取真正支持或反驳某个创意组件的片段,并解释它与研究动机、问题、方法或实验之间的具体联系。相比把大量搜索结果直接塞给评审模型,这一步能够过滤噪声,让后续判断建立在更明确的证据链上。
2.4 用“评审委员会”完成五维解耦评价
InnoEval构建了一个学术人格池。每个评审人格都包含学术背景、对论文/网页/代码知识的熟悉程度以及评审偏好。系统会按照熟悉程度遮蔽一部分知识,以模拟真实专家有限而不同的认知边界;随后为每个创意随机选择五名评审者,而不是让同一个模型重复采样五次。
在每个评审视角下,五个专门的评价智能体分别对清晰度、有效性、新颖性、可行性和重要性给出0—10分与详细理由,用户也可以注册新的自定义维度。最后,报告智能体综合所有检索证据和评审意见,生成元评审、最终分数、Reject/Poster/Spotlight/Oral决策以及具体修改建议。对于多个创意,InnoEval还可以比较各维度的优劣并输出完整排序。
三、实验
为了覆盖真实科研中的不同使用方式,本文从ICLR 2025和NeurIPS 2025的OpenReview投稿中构建了三类评测数据:
•单点评估(Point-wise):包含217个经人工校正的创意,其中138个Reject、66个Poster、9个Spotlight、4个Oral,用于判断“拒稿/接收”或“拒稿/Poster/Highlight”;
•成对比较(Pair-wise):包含372对创意,其中172对标签差距较大的简单样本和200对标签相邻的困难样本,用于选择更好的创意;
•分组排序(Group-wise):包含172组主题相近的创意,用于选出组内最佳方案并恢复完整排名。
所有方法统一使用DeepSeek-V3.2作为骨干模型,比较对象包括CoT、RAG、ResearchAgent、InternAgent以及专门的创意评估方法GraphEval和ScholarEval。
![]()
定量结果显示,InnoEval在单点、成对和分组三种评估任务的所有指标上均取得最佳表现。论文还观察到,多数基线会出现明显的标签坍缩:模型倾向于只预测一两个类别,因此宏平均F1显著低于准确率。InnoEval借助证据支撑、维度拆分和多视角讨论,使预测更均衡,三分类F1甚至略高于准确率。
![]()
除了预测最终决策,评估报告是否真正“有用”也很重要。本文使用o4-mini从合理性、证据支持度、分析深度、建议建设性和整体质量五个方面比较报告。在与所有基线的对比中,InnoEval的整体质量胜率均超过 70%;相较多数方法,其分析深度胜率超过 90%,修改建议的建设性胜率超过 80%。这说明异构知识与多维评审带来的收益不仅体现在标签上,也体现在评语的证据性和可操作性上。
![]()
在人类评价中,作者邀请5位AI领域专家对随机抽取的60个创意进行五维打分,并进一步从真实OpenReview评语中抽取对应维度的评分。InnoEval与人类专家、真实评审在全部五个维度上的Pearson相关系数均不低于 0.5。
![]()
消融实验进一步验证了各模块的作用。移除证据对齐会在三类任务上造成稳定下降,说明检索到知识之后仍需要过滤噪声并建立细粒度联系;关闭学术人格、退化为直接LLM-as-a-Judge,会在单点评估和分组排序上带来尤其明显的损失;只检索论文而移除网页与代码,也会使成对和分组任务显著下降,表明比较多个相近创意时,比评价单个创意更依赖丰富的背景知识。将骨干模型替换为o4-mini后,InnoEval仍能超过最强基线,说明收益并不局限于单一模型。
四、分析 4.1 真正有效的测试时扩展来自“多元共识”
![]()
随着采样次数增加,不带人格和带人格的评估都会变好,但普通Test-Time Scaling很快趋于饱和,而引入不同学术人格后的曲线仍持续上升。原因在于,前者只是迫使同一个裁判生成不同说法,后者才是在模拟不同背景专家独立审阅后形成共识。一个颇具启发性的现象是:在分组排序中,只使用一个人格甚至不如完全不使用人格——这只是把模型原有偏见替换成某个特定评审者的偏见。论文最终选用5名评审者,是效果与推理成本之间的折中,而不是能力上限。
4.2 高质量检索不能只有“相关”,还要兼顾覆盖与多样性
![]()
在相关密度、主题覆盖、多样性和资源质量四项检索指标上,InnoEval取得了更均衡的结果。ScholarEval虽然能找到高度相关的论文,但检索结果容易收敛到相似内容,牺牲主题覆盖和多样性;面向综述生成的AutoSurvey则更重视广泛召回,却无法保证每条证据都紧密服务于创意评价。InnoEval的异构检索恰好补足了“只查论文”的盲区。
4.3 好的评价可以反过来改善创意生成
![]()
作者把不同评价方法生成的反馈接入ResearchAgent的创意迭代流程。InnoEval的建议能够同时改善问题定义、方法设计和实验方案,说明评估系统不仅可以“打分”,还可以成为创意优化器。相比之下,只关注贡献和正确性的ScholarEval会引导创意进行偏科式优化,反而降低最终生成质量。
4.4 决定“能否接收”和“能否成为亮点”的因素并不相同
![]()
回归分析显示,新颖性是决定一个创意能否跨过接收门槛的最关键因素,有效性、重要性和可行性也具有明显影响,而清晰度相对较弱。但当问题从“能否接收”变为“能否从Poster升级为Highlight”时,可行性的重要程度显著上升,其余维度也都需要保持较强水平。换言之,一个突出创意既要足够新,也要能够被完整而可信的实验真正验证。
![]()
五个维度之间的关系也呈现出与科研直觉一致的模式:重要性与新颖性、有效性分别具有较强正相关;有效性与可行性也明显正相关,理论上站得住脚的想法通常更容易通过实验验证。与此同时,新颖性与有效性、可行性呈轻微负相关,反映了真正创新的方案往往更难获得既有理论支持,也更难通过标准实验确认。InnoEval捕捉到的不是简单的“好创意各项都高”,而是科研评审中真实存在的维度张力。
五、结论
本文提出 InnoEval,将科研创意评估从单一LLM打分重构为一个由动态知识、证据对齐、多维指标和多背景评审共同驱动的推理过程。系统从论文、网页和代码中寻找“活知识”,让不同学术人格独立评审,并最终生成带引用证据、细粒度分数、元评审决策和修改建议的完整报告。在单点判断、成对比较和分组排序三类真实投稿数据上,InnoEval均显著优于现有方法,其评分模式也与人类专家和真实同行评议保持较高一致性。
这项工作的价值并不只是做出一个更强的“AI审稿人”,而是展示了自动科研中一个容易被忽略的方向:当创意生成越来越便宜时,可信的创意筛选、比较和迭代将成为新的核心瓶颈。
当然,InnoEval目前仍主要面向AI领域和文本形式的创意,单个样本的完整评估约需半小时,系统也无法彻底消除检索错误、模型幻觉和评审偏见。论文因此明确主张人机协同:让InnoEval扩展专家的知识视野、暴露潜在风险并提供第二意见,而不是用自动评分替代最终的学术判断。未来值得探索的方向包括跨学科评估、多模态创意输入、更高效的深度检索,以及让人类评审与AI委员会在真实科研流程中形成可追踪、可校正的协作闭环。
Illustration From IconScout By IconScout Store
9月28日晚@美国匹兹堡
「IROS 2026 群星闪耀 精英晚宴」
免费报名,期待线下见面!
北京时间9月25日(周五) 12:00截止报名
-The End-
本周上新!
扫码观看!
“AI技术流”原创投稿计划
TechBeat是由将门创投建立的AI学习社区(www.techbeat.net)。社区上线700+期talk视频,3000+篇技术干货文章,方向覆盖CV/NLP/ML/Robotis等;每月定期举办顶会及其他线上交流活动,不定期举办技术人线下聚会交流活动。我们正在努力成为AI人才喜爱的高质量、知识型交流平台,希望为AI人才打造更专业的服务和体验,加速并陪伴其成长。
投稿内容
// 最新技术解读/系统性知识分享 //
// 前沿资讯解说/心得经历讲述 //
投稿须知
稿件需要为原创文章,并标明作者信息。
我们会选择部分在深度技术解析及科研心得方向,对用户启发更大的文章,做原创性内容奖励
投稿方式
发送邮件到
yimingzhang@thejiangmen.com
或添加工作人员微信(aceyiming)投稿,沟通投稿详情
关于我“门”
将门是一家以专注于数智核心科技领域的新型创投机构,也是北京市标杆型孵化器。 公司致力于通过连接技术与商业,发掘和培育具有全球影响力的科技创新企业,推动企业创新发展与产业升级。
将门成立于2015年底,创始团队由微软创投在中国的创始团队原班人马构建而成,曾为微软优选和深度孵化了126家创新的技术型创业公司。
如果您是技术领域的初创企业,不仅想获得投资,还希望获得一系列持续性、有价值的投后服务,欢迎发送或者推荐项目给我“门”:
bp@thejiangmen.com
![]()
点击右上角,把文章分享到朋友圈
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.