![]()
你有没有想过,AI写论文这件事,到底缺了点什么?
如果你让市面上主流的大语言模型帮你想一个科研点子,大概率会得到一份工整、逻辑通顺、但读完让人打哈欠的方案。像极了那种永远按标准流程办事的学生,作业交得很规整,从不出错,但你也永远别指望他给你带来惊喜。
这不是错觉。微软和伊利诺伊大学的研究团队做了个实验:让一个8B参数的Qwen3模型直接生成科研提案,拿去跟真实拿到NSF(美国国家科学基金会)资助的项目方案对比,结果这个模型的方案被判定"更有影响力"的概率只有0.46%。
**几乎是全军覆没。**
换成更强的GPT-4.1,这个数字也只爬到3.9%。也就是说,即便是当下最聪明的语言模型,一百次里也就赢三四次,剩下九十六次都是普普通通、平平无奇的常规答案。
这篇发表于2026年的论文,标题叫《用夜间科学强化科学构想中的智能体创造力》,试图回答一个具体问题:能不能通过强化学习,教会AI"什么时候该异想天开,什么时候该按部就班"?
白天做实验,晚上做梦
科学史上有个说法,叫"白天科学"和"夜间科学"。
**白天科学**:结构化、按流程走的科研范式,提出假设、收集数据、验证或推翻,每一步都清清楚楚。
**夜间科学**:松散、直觉驱动、充满意外的探索过程,比如某天灵光一闪、和跨领域的朋友聊天时突然被启发、推翻一个大家从没质疑过的假设。
青霉素的发现就是夜间科学的典范。弗莱明不是设计实验去找抗生素,而是发现培养皿被意外污染后,细菌死了。这个"意外"如果发生在一个只会按流程走的研究者身上,可能直接被当作实验失败扔进垃圾桶。化疗药物的发现路径也差不多,都不是规规矩矩推导出来的,而是某个时刻研究者的思维突然拐了个弯。
现在的AI科研助手,几乎清一色是白天科学的信徒。它们搜索文献、写报告、迭代修改,流程走得比谁都规矩,但从不"拐弯"。这篇论文的核心洞察是:**创造力不应该只是最终输出的一个属性,它应该嵌入到整个推理过程里,成为一种可以调节的行为**。
打个比方,这就像做菜。白天科学式的AI是那种严格按菜谱称量、精确到克的厨师,做出来的菜永远不出错,但也永远是那个味道。夜间科学式的思维,是那种偶尔心情一来往锅里扔点意想不到的香料的厨师。如果永远不敢乱来,你可能一辈子做不出一道让人惊艳的新菜;但如果每次都乱来,大概率是要把厨房烧了的。真正厉害的厨师,知道什么时候该守规矩,什么时候该放手一试。
问题是,怎么让一个语言模型学会"什么时候该放手一试"?
三个层次的创造力:动作、过程、结果
研究团队没有简单地把"创造力"当成一个模糊的形容词,而是把它拆解成了三个可以操作的层次。
**动作层创造力**:同一个行为,可以用保守的方式做,也可以用大胆的方式做。比如"搜索文献"这个动作,你可以只搜和你研究主题直接相关的论文(保守),也可以故意搜一个完全不相关领域的文献碰碰运气(大胆)。
**过程层创造力**:不是每一步都要大胆,也不是每一步都要保守,关键是知道什么时候切换。前期多探索几个方向,后期锁定一个方向深挖,这种节奏感本身就是一种创造力。
**结果层创造力**:最终产出的点子,既要新颖,又要真的有用。光新颖没用,异想天开谁都会,难的是既新又靠得住。
论文里给了一个特别具体的例子。假设任务是"用AI改进教育",一个低创造力的搜索动作,可能是去查"教育与大语言模型"这种字面直接相关的关键词;而一个高创造力的搜索动作,是去查"内在动机"这种看似不相关、实际上可能提供全新视角的概念。同一个"搜索"动作,创造力刻度不同,结果天差地别。
这套三层框架背后有认知科学的支撑。有学者提出,创造性问题解决存在一个连续谱,从"维持既有范式"到"拉伸范式"再到"打破范式"。还有理论区分了"在已有概念空间里探索"和"直接改造概念空间本身"这两种完全不同的创造模式。这篇论文相当于把这些心理学理论,第一次系统地翻译成了可以训练AI的具体机制。
给AI一套"行动菜单",每个动作都能调节大胆程度
具体怎么落地?研究团队设计了一个叫**AI夜间科学家**的智能体框架,核心是一套五个动作组成的行动空间。
**Search(搜索)**:生成检索词去查arXiv论文。1级只搜和提案标题直接相关的背景资料,5级则搜索完全不相关的领域、另类视角,甚至哲学性问题。
**Debate(辩论)**:设定参与者和话题,模拟一场讨论。1级是找同领域的近邻同事聊具体细节,5级是找完全不同学科的专家进行一场开放式的头脑风暴。
**Spark(灵光一闪)**:识别一个普遍被接受的假设(Bit),把它反转过来(Flip),提炼成一句话的核心洞察(Spark)。1级只挑战提案里一个很窄的具体假设,5级挑战整个领域级别的根本性假设。
**Write(写作)**:把之前收集的一切整合成提案草稿,这个动作是固定的,不参与创造力调节。
**Stop(结束)**:结束整个推理过程,返回最终提案。
这五个动作里,Spark这个设计特别值得说一说。它借鉴了"假设反转"的思路,本质上就是逼着模型去问:这个领域里大家都习以为常、从没质疑过的东西是什么?如果反过来会怎样?
这有点像相声里的"抖包袱"。一个笑话好不好笑,往往取决于前面铺垫得多正常,反转来得多突然。如果一上来就一本正经地反转,没人会觉得意外;如果铺垫足够扎实,让你以为事情就该这么发展,然后猛地一个转折,那种"啊原来还能这么想"的感觉才会出现。Spark动作干的就是这件事:先老老实实承认现有假设的合理性,再狠狠地把它掀翻。
模型在每一步都要选择"用哪个动作"和"用多大的创造力等级"来执行它,一步步构建出一条完整的推理轨迹,最后汇聚成一份科研提案。这个过程借鉴了ReAct框架的思路。
**ReAct**:一种让语言模型交替进行"推理"和"行动"的框架,模型每一步先思考该做什么,再执行具体操作,如此循环。
用强化学习去"调教"创造力,而不是靠猜
光有这套行动菜单还不够,因为如果不告诉模型"什么时候该大胆、什么时候该保守",它大概率会一直选保守选项,因为保守选项风险低、看起来最"安全"。
研究团队用了**GRPO**(群体相对策略优化,一种不需要额外训练价值网络、通过比较同一批采样结果的相对好坏来更新策略的强化学习算法)来训练模型。核心思路是让最终提案的质量,反过来去塑造整个推理过程中的选择。
具体的奖励机制拆解成了三个维度。
**先驱性**:这个点子是不是真的和现有工作不一样,有没有开辟出新的技术方向。
**可行性**:执行计划够不够具体、有没有先例可循,还是空泛得让人怀疑能不能真的做出来。
**相关性**:这个点子是不是真的在解决原始研究问题,还是跑偏了。
论文里还提到一个细节:因为一份科研提案里往往包含好几个想法,各自的新颖度和可行度可能天差地别,所以团队先把提案拆解成一个个"原子想法",分别打分,再汇总。先驱性和相关性取平均,可行性取最低值,因为一个提案里只要有一个环节不靠谱,整个执行就可能崩掉。这就像一条链子,链子的强度取决于最脆弱的那一环,不是取决于平均强度。
除了这套基础的结果奖励,团队还试了两种额外的引导机制。第一种叫**意外行动干预**,训练早期以一定概率(初始0.5,逐渐衰减)随机替换模型本来要选的动作,强行让它体验一些原本不会主动选的行为组合。这个设计的动机很朴素:研究者的很多重要发现,都来自一些他们本来没打算做的事情,如果AI从一开始就只重复自己熟悉的套路,永远不会知道"意外"能带来什么好处。
第二种是**过程奖励**,直接给推理过程中的每一步中间动作打分,从"探索性"(这一步和之前的步骤比,是不是真的探索了新方向)和"贡献度"(这一步对最终提案质量的实际贡献有多大)两个维度衡量。
温度调高不等于变聪明
这篇论文里最有意思的一个发现,可能会颠覆很多人对"AI创造力"的直觉理解。
很多人以为,想让AI输出更多样、更有创意,只需要把**采样温度**调高就行了。
**采样温度**:控制语言模型生成文本时随机性大小的参数,温度越高,模型越可能选择低概率但不常见的词,输出也就越"发散"。
研究团队专门设计了一个对照实验,把同样的五级创造力等级,映射成五档不同的采样温度(从0一直到1.0),其他条件完全一致,也用强化学习去训练。
结果是:单纯调高温度这条路,效果差得离谱。经过强化学习训练后,温度版本的原创性得分只提升到19.82%,而用语义化创造力等级训练出来的版本,原创性直接冲到56.32%,差了整整36.5个百分点。
这个差距说明了一件事:**随机性本身不等于创造力**。
温度调高,模型确实会说出一些不常见的词,但这些词可能只是统计意义上的"生僻",不代表方向上真的有新意。这就像给一个只会抄作文模板的学生,硬塞进去几个生僻词汇,句子读起来是奇怪了,但思路还是那个旧思路。真正的创造力需要的不是"说话方式变得奇怪",而是"思考方向真的变了"。
而语义化的创造力等级,相当于直接告诉模型"你现在该往哪个方向偏",比如"去查一个完全不相关的领域"或者"去挑战一个更根本的假设"。这是给出具体的方向指引,不是简单地往骰子上加更多面。
论文还专门做了个量化验证来证明这一点。他们跟踪训练过程中,模型选择的创造力等级和实际输出行为之间的相关性,用输出的信息熵和语义相似度来衡量。结果显示,用语义化创造力等级训练的模型(AI夜间科学家),这个相关性在训练过程中持续走高;而用温度训练的模型,相关性反而一路跌到接近负0.9。
这说明温度这个旋钮和模型实际输出行为之间,压根没建立起稳定的对应关系。你告诉它"现在是5级创造力",但它的实际输出可能和1级时没什么本质区别,因为温度只是给随机数生成器调了个参数,模型自己并不"理解"这个数字意味着什么。而语义化的描述,模型是能"读懂"的,因为它本质上还是自然语言指令,模型可以在训练中真正学会把这句话和相应的行为对应起来。
光靠"搜索加写作"不够,得有能拐弯的动作
另一个值得细品的实验结果,是关于**行动空间**(模型可以选择执行的所有动作的集合)本身有多重要。
研究团队做了一个精简版对照:把整套五个动作砍到只剩Search和Write两个,也就是"检索文献、写提案"这种最接近现有检索增强生成系统的做法,其他设置不变,同样接受强化学习训练。
结果原创性直接掉了22.99个百分点。
这说明单纯多检索、多迭代写作,解释不了完整版模型带来的提升。Spark和Debate这两个动作提供的,不是"更多证据支撑同一个方向",而是真正把推理方向"扳"到别处去的能力。
这就好比装修房子。如果你只有"量尺寸"和"下单买材料"这两个工具,你能把房子装修得很规整,但你永远不会想到把客厅和厨房打通、或者把楼梯挪个位置这种颠覆性改动。真正能带来惊喜的改动,往往需要一个类似"设计师突然推翻原方案"的环节,而这正是Spark和Debate在整个系统里扮演的角色。
数据说话:8B模型的提升有多大
具体的实验数字,比任何形容词都更有说服力。
论文用NSF(美国国家科学基金会)2018年以后资助的计算机科学、工程和数学类项目,构建了4414个训练样本和491个测试样本。因为原始的NSF提案文本不公开,团队用GPT-5.1,结合项目摘要、成果报告和相关论文,反向重构出一份"合理的原始提案"作为参照基准,模型本身完全看不到这些"标准答案"信息,只拿到一句项目标题。
评估用了三个维度:**预测引用影响力**(用一个专门训练来预测论文引用量的30B判别模型SciJudge,衡量提案潜在价值)、**基于文献的原创性**(找到提案最相关的现有论文,让GPT-5.1做对比判断)、以及**研究想法多样性**(衡量模型是不是老在重复同一类研究范式)。
在8B参数规模下,相比原始Qwen3-8B基座模型,AI夜间科学家的预测引用影响力提升了29.43个百分点,原创性提升了53.79分。换到14B规模,这两个数字进一步扩大到32.03和66.15分。
有个对比特别扎心:把零样本模型(不训练、直接生成提案)从8B放大到14B,几乎没有提升。但把AI夜间科学家从8B放大到14B,又能再涨3.29分引用和12.36分原创性。这说明单纯堆参数规模,如果没有配上一个学会了创造性推理的策略,很可能是白费功夫。
研究想法多样性上,用一套改编自HCI(人机交互)研究贡献分类法的七类范式体系来衡量,AI夜间科学家把归一化的范式覆盖度从0.738提升到0.943,相当于多覆盖了大约1.4个有效类别(满分对应7个类别)。这意味着模型不再是反复输出同一种套路的方案,而是真的展开了更广的方向。
而且这种提升不是只在AI相关领域好用。论文在36个评估领域里都做了对比,涵盖医疗健康、生物医学工程、地球科学、量子科学这些和计算机关系不大的方向,结果在所有36个领域,AI夜间科学家在引用和原创性两个指标上都超过了零样本基座模型。这说明训练学到的不是某个特定学科的知识窍门,而是一种更通用的、可迁移的创造性推理能力。
过程奖励是把双刃剑
前面提到的过程奖励机制,看起来是个不错的补充,但实验数据揭示了一个微妙的取舍。
加上过程奖励之后,原创性得分从56.32涨到61.61,提高了5.29分。但预测引用影响力却从29.89掉到26.20,下降了3.69分。范式多样性和贡献类型多样性也各自下滑了大约0.6和0.4个有效类别。
这个结果很有意思。直接奖励中间推理过程,确实能让模型更倾向于产出个体上更"炸裂"的单一提案,但代价是覆盖的方向变窄了,整体的靴子有可能不太合脚。研究团队分析发现,加了过程奖励后,模型明显更偏爱使用Spark这个"挑战假设"的动作,而且倾向于用中高创造力等级去执行它。
这就像一个作家,如果太在意"这一段写得够不够惊艳",反而可能满篇都是华丽的转折和金句,读起来爽是爽,但整本书的结构感和完整性可能会打折扣。而如果只在意最终这本书交出去后的整体评价,作家反而会更均衡地分配笔力,该平实的地方平实,该出彩的地方出彩。
值得一提的是,这个效应是和创造力对齐的行动空间绑定的。如果把同样的过程奖励加到ReAct这种没有语义创造力等级的基线模型上,引用和原创性反而双双大跌。这说明过程奖励不是万能药,它的效果取决于底层的行动空间是不是提供了真正语义上不同的创造力表达方式。基于这个发现,团队最终把"只用结果奖励"作为主要训练方案,把过程奖励当成一个可选的、用来把模型推向更高原创性的调节旋钮。
一个具体的例子:从"分段讲课"到"故意留错让你自己纠"
抽象的数字说完了,来看一个论文里给出的具体案例,题目是"用AI改造在线视频讲座"。
GPT-4.1给出的方案,是用AI把预录讲座切成小段,配上对话式智能体,支持自适应节奏和多模态无障碍功能。读起来挺周全,但仔细一想,这基本是把现有的讲座分段技术和聊天机器人技术拼在一起,没有真正的新意。
用ReAct框架跑出来的方案,提出了一个"多模态参与度评分",综合视觉、听觉和生理信号,实时调整讲座节奏。这个评分本身是个具体的新点子,但后面用强化学习去优化这个评分的机制描述得很模糊,状态、动作、奖励空间都没交代清楚。
AI夜间科学家(只用结果奖励)给出的方案叫**Agentify**,思路是把一段预录好的讲座,变成一个实时的、由AI主持的互动课堂,AI根据学生的实时反应,随时插入提问、提示和对话。这已经是一次不小的重新构想:讲座不再是"内容传递",而是变成了"AI主持的现场互动"。
而加了过程奖励的版本,提出了一个叫**渐进式内容制造者**(PCE)的概念,思路更大胆:故意在讲座内容里埋入设计好的错误和模糊之处,逼着学生主动去发现和纠正它们,把被动听讲变成主动解题。这个想法确实新颖,类似"刻意练习"和"生产性失败"这些教育心理学里已经验证过的理念,但被套用到了讲座这个新场景里。不过这个版本也暴露了过程奖励的副作用:方案里塞了一堆听起来很专业但根本无法验证的量化指标,比如"认知参与度评分0.12"、"3.5个标准差的记忆提升",这些数字看起来很有说服力,实际上没有任何依据。
**这个案例恰好印证了前面数据里揭示的规律**:
过程奖励能推着模型想得更远,但也可能让它在细节的严谨性上打折扣。
写在后面
读完这篇论文,我最先想到的不是AI科研本身,而是一个更普遍的问题:我们总说要"培养创造力",可创造力到底是什么?这篇论文给出的答案挺朴实,创造力不是一种玄妙的天赋,它可以拆成"用什么方式做一件事"、"什么时候切换做事方式"、"最后做出来的东西够不够新又够不够靠得住"这三层可操作的东西。这个拆解方式,其实也适用于人。
论文里那个温度实验的结果让我印象很深。很多人(包括我自己)下意识觉得,创意来自某种混沌和随机,多喝点酒、多放空一会儿,灵感就来了。但这篇论文用数据说明,纯粹的随机性带来的"新奇",往往是空洞的新奇,就像给一段平庭无奇的话强行塞进几个生僻词,读起来怪,但没有实质变化。真正管用的,是有方向感的偏离,知道自己要往哪个不寻常的方向偏,而不是漫无目的地乱走。这某种程度上打破了我原来对"创造力等于随性"的朴素想法。
另一个让我反复咀嚼的细节,是过程奖励那个"原创性涨了但覆盖面窄了"的取舍。这几乎是任何追求"深度"和追求"广度"之间永恒的张力,不管是写论文、做产品还是过日子,太专注于把某一件事打磨到极致,往往会牺牲探索更多可能性的机会。这篇论文用一套严谨的强化学习实验,把这个直觉上大家都懂的道理,变成了可以量化、可以调节的旋钮。
论文里也留了一个没答完的问题:现在这套框架里,Debate这个动作因为需要先选参与者、检索相关证据,才能生成对话内容,消耗的推理步数比较多,所以模型实际很少选它。这暴露了一个更深的矛盾:一个动作的创造性潜力,和它在有限推理预算下的"性价比",未必是一回事。真正有价值的探索,往往也是最费时费力的那种,这在AI系统里如此,在人类科研里,大概也是如此。
Q&A
Q1:AI夜间科学家是什么?
A:AI夜间科学家是一个基于强化学习的智能体框架,通过在行动、过程、结果三个层次上引入可调节的创造力等级,训练语言模型学会何时以及如何偏离常规、高概率的推理路径,从而生成更有创意的科研提案。
Q2:为什么单纯调高AI生成时的采样温度不能提升创造力?
A:论文实验发现,温度版本训练后原创性得分只有19.82%,远低于语义化创造力等级版本的56.32%。温度只是增加输出的随机性,不代表模型真正理解该往哪个方向偏离,而语义化描述能让模型学会具体的创造性行为模式。
Q3:AI夜间科学家相比基础模型提升有多大?
A:在8B参数规模下,相比零样本基座模型,预测引用影响力提升29.43个百分点,原创性提升53.79分;14B规模下分别提升32.03和66.15分,且在36个测试领域全部实现正向提升。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.