![]()
导语
2003 年,Jürgen Schmidhuber 提出了哥德尔机,之后随着大模型的出现,出现了哥德尔智能体等多个变体。近日arXiv的论文,提出红皇后协同演化哥德尔机(Red Queen Godel Machine,之后简称RQGM),并通过比较其与哥德尔智能体(Gödel Agent)、郝胥黎哥德尔机(HGM) 及原始哥德尔机的异同,阐述了哥德尔机的演化逻辑。
关键词:智能体,递归改进,哥德尔机,红皇后假说
郭瑞东丨作者
赵思怡丨审校
![]()
论文题目:The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators 论文链接:https://arxiv.org/abs/2606.26294 发表时间:2026年6月24日 论文来源:arXiv
RQGM让评价标准变成动态
哥德尔机的核心,在于构建一个能够自我改进的计算系统,该系统能找到一个数学证明,证明对自身的重写(包括重写其证明生成器本身)是有用的(能增加预期效用),它就会执行该重写。
然而,上述方法面临一个致命盲区,它假设评估标准是静态的,如固定的验证器或基准数据集。但真实演化中物种必须随着环境(和其他物种)的变化而适应。就如童话《爱丽丝镜中奇遇记》中红皇后对爱丽丝说的话:“在我们这儿,要保持原地不动,你得跑得飞快。”
进化生物学家利·范·瓦伦(L. van Valen)提出的红皇后假说,指出在生态系统中,一个物种的进化改进都可能构成对其他物种的竞争压力,哪怕环境不变,种间关系也可能推动生物进化。
借用红皇后假说,RQGM 将智能体对解的搜索组织成多个“纪元”(epochs)。在一个epoch 内,评估标准固定,从而保证自我改进的可靠性(类似哥德尔机的证明保证);而在epoch边界,效用函数(utility)和评估器可以被更新。这使得评估器(evaluator)和目标能够与智能体协同演化。
具体来看,RQGM包含一个不断生长的树状结构,对应解的搜索空间。树中的每个节点代表一个具体的智能体实例,该实例包含任务智能体和评估器。在系统启动时,RQGM构建初始的搜索空间与评估基准,同时引入一组绝对可靠的、预先设定的基准数据(如人工标注的黄金标准测试集)。这些数据往往是持久化的,贯穿整个演化过程,不受纪元更替的影响。
![]()
图1:RQGM的核心架构与算法流程图
在单个纪元内部,决定下一步对搜索树中的哪个节点进行操作时,系统不单纯贪心地选择当前得分最高的节点,而是评估整个“分支(子树)”的历史潜力,通过汤普森采样(Thompson Sampling)平衡“探索(尝试新分支)”与“利用(深挖高分分支)”,选出一个目标节点。
选中一个节点后,元智能体 (Meta-agent) 介入,读取当前节点的代码/提示词及其历史评估反馈。元智能体生成修改建议(如重构逻辑、优化推理步骤),生成一个新的子节点(子代 Agent)加入工作空间树。之后将选中的 Task Agent 放入任务环境中运行,试图解决预期问题。评估器对预期问题进行打分,获得效用值。这一步通过冻结评估器,确保了对任务智能体的优化使用同一标准评估。
当某一纪元结束,系统进行评估器替换与选择性擦除。这对应了红皇后假说,通过引入持续变化的评估器、实现协同演化。系统将搜索过程中变异得到的候选评估器与当前的评估器放在一起,让它们对保留的真实数据集进行打分,计算各自的打分与真实标签之间的误差/准确率,从中选出表现最好的 n个评估器,成为下个纪元的评估器。
![]()
图2 :评估器替换过程中的数据持久性与信息流动策略,基准评测永久保留,而跨纪元后被替换评估器产生的所有历史效用记录会被彻底擦除
由于保留数据集是绝对真实的,这为评估器的质量评估提供了客观标准。同时评估器的不断改变,能够避免求解器去优化特定评价指标而非真正关注的问题,这可以防范古德哈特定律(Goodhart's Law)描述的现象,即"当一个度量指标成为目标时,它就不再是一个好的度量指标。"
而一旦评估器被替换,系统会永久擦除或标记失效所有由被替换的旧评估器产生的效用记录(图2中通过擦除符号或虚线断裂来展示这一过程)。在新纪元 ϵ+1中,求解器通过新的评估操作重新积累证据。这类似红皇后假说中“必须跑得飞快,才能在新标准下保持不动”。而让求解器重新演化以适应新环境,能避免了在单一静态标准下的“应试教育”和过拟合。
RQGM搜索更快且更好
在Polyglot编程任务上,RQGM相比目前最好的哥德尔智能体变体(HGM-H),能用更少的计算资源达到更好的性能(图3左)。每次评估器替换时,因为选择性擦除丢弃了被替换评估器的记录,得到解的效用下降,然后在新评估器下重新上升(图3右)。
![]()
图3:RQGM 借助低成本进化代码评审器,在 Polyglot 上节省了1.35–1.72倍的搜索Token,超越SOTA 模型HGM-H。
在更具挑战性的IMO数学证明评分任务(IMO-GradingBench)上,RQGM的表现揭示了其在复杂协同环境中的卓越性能。图4左侧的性能与成本对比图可以看出,RQGM找到的全局最优评估器(以心形标记)不仅在评分准确率上达到了最佳水平,而且其搜索成本(Token消耗)仅为先前最优方法的三分之一。这说明通过让评估器与求解器在动态环境中协同演化,系统能够以极高的计算效率突破复杂数学推理评估的性能瓶颈。
![]()
图4:RQGM在IMO数学证明任务上的表现
图4右侧的搜索轨迹图展示了RQGM“受控效用演化”。随着搜索Token的增加,评估器和求解器效用呈现出明显的锯齿状上升曲线。每当搜索到达纪元边界(图中带皇冠的标记处)触发评估器替换时,由于选择性擦除机制清空了旧评估器留下的历史效用记录,曲线会出现短暂的下降;随后,系统在新的评估标准下重新积累证据,效用再次攀升。这对应了红皇后假说中的动态适应过程,即智能体必须不断重新演化以跨越不断提高的评估门槛。
在当前的AI科研辅助系统中,大语言模型常被用作自动评审员。然而,研究发现标准的AI评审员对AI生成的内容存在严重的偏好。这导致训练出的写作智能体只是在“迎合”AI评审员的口味,而非真正提升论文质量。
![]()
图5:对抗性RQGM纠正评审器的AI偏见
RQGM引入对抗性演化机制,迫使评审器在演化过程中消除对AI文本的偏好,使得评审器以相似的比率接受AI和人类论文。图5左图中的虚线标出了数据集的真实接受率基准,RQGM评审器能够在保持极高准确率的同时,将其整体接受率完美贴合真实基准。相比之下,对比模型HGM-H虽然通过“放水”过度接受AI论文来刷高表面的原始准确率,但这实际上是一种虚假的繁荣,导致其训练出的写作器质量低下;而Sakana模型则走向了另一个极端,表现出过度严苛的倾向。RQGM则在这两者之间进行权衡。图5右同样出现锯齿状的效应演化曲线,说明在公平、校准良好的评估器的筛选下,才可能出现真正高质量的内容。
RQGM的Token消耗分析
当使用Nemotron 3 Ultra替代部分GPT-5.5后,Token降低为原来的13分之一,但性能几乎没有下降(图6),考虑到Nemotron 3 Ultra的单Token成本更低,这说明通过混合使用不同规模和成本的模型,可以大幅降低RQGM的Token成本而不显著牺牲性能。
![]()
图6:RQGM通过混合模型策略降低Token消耗。
相比哥德尔智能体,其优化往往局限于修改提示词,RQGM对自身的修改,包含系统架构、核心业务逻辑及元认知层面。通过观察图7中不同任务下五种不同类型代码的修改占比,可以揭示RQGM在不同任务中的自适应演化策略。
图中的深蓝色是多任务共享的模块,属于多个任务智能体(如论文写作中的Writer和Reviewer,或数学证明中的Prover和Grader)共同调用的通用代码、基础提示词或共享的推理逻辑。浅蓝色代表支撑智能体运行的基础设施底层框架代码,包括工具调用、API封装、环境配置、测试运行脚本。黄色对应特定角色独有的代码及提示词。而红色则是负责生成修改建议的“元智能体(Meta-agent)”自身的代码或提示词。这对应 “修改改进器本身”。当系统发现当前的演化策略(如何寻找代码漏洞、如何生成修改建议)效率低下时,它会通过修改Meta-agent模块来优化未来的搜索和突变策略。
![]()
图7:在递归自我改进的过程中,RQGM修改自身不同类型的占比
图7展示了不同任务对应不同的修改占比,编程任务往在基础设施和 角色特定上呈现出较高的修改比例。学术写作和评审更侧重于通用逻辑、论证结构和学术规范。写作智能体和评审者智能体需要共享对“高质量论文”的理解,因此任务共享类对应的修改占比相对较高。其中使用Nemotron 3 Ultra的模型展现出与使用GPT5.5 模型不同的点在于其进行了元智能体对应的修改,这可能解释了为何该模式下,搜索用到的Token显著降低,原因是元智能体不断进化其“如何拆解复杂证明”、“如何引导搜索方向”的元策略,从而避免了在无效的逻辑分支上浪费算力。
RQGM的演化历程与发展
了解了RQGM后,让我们回溯历史,看看其发展历程,并对比RQGM与其各类变体的差异。最早的哥德尔机[1],要求系统能找到一个数学证明,证明对自身的重写是有用的,然后据此对系统进行改写。但其问题在于形式化的证明在复杂的现实环境中需要海量计算,还会遇到逻辑不完备性挑战,这限制了哥德尔机的落地。
2024年出现的哥德尔智能体[2],不依赖形式化的证明,而是将大模型作为“求解器”的近似。通过高层目标的提示(prompting),大模型能够动态修改自身的逻辑和行为,实现递归自我改进,这类智能体,其演化如达尔文的进化论所描述。
2025年出现的郝胥黎哥德尔机[3] (Huxley-Gödel Machine, HGM)针对自我改进编码智能体中存在的当前基准测试得分高,不代表未来改进潜力大这一问题,引入了生物学中“进化支”(clade)的概念,通过考察智能体后代的基准性能来评估其真实的自我改进潜力。HGM把关注点从单个智能体扩展到它和所有后代组成的整个枝系(clade);整个枝系的性能可被视作“形式证明价值函数”的近似值,更接近哥德尔机。HGM能在 SWE-bench 等任务上达到了人类水平的编码能力,且资源消耗更低。
除了上述系统,还有一些与RQGM相关的系统,例如Hyperagent[4]使用“任务智能体+ 元智能体”成对结构,每个节点内不止一个智能体,而是一对“执行 + 设计”;Hyperagent和RQGM的相似之处在于其都涉及原层面的自我改进。Hyperagent改进了其生成新智能体的方式(例如持久记忆、性能跟踪),这些元级改进在不同领域之间转移,并在多次运行中累积,其与RQGM的区别在于评估者本身并未协同进化。
Digital Red Queen[5]在图灵完备的虚拟机环境,将两个或多个被称为“战士(warriors)”的类汇编语言程序被加载到同一台虚拟机中,每个程序试图通过执行指令来夺取虚拟机的控制权,或让对手停止运行。自我对弈时留下的那个大模型驱动的智能体,成为下一轮需要击败的目标,这类似红皇后假说。但其与RQGM的区别在于其主要在对抗性程序进化层面,而非评估者本身也在演化。
而针对上下文长度较短的小参数语言模型,Polaris[6]提出不试图记住所有的失败细节,而是将失败“抽象”为紧凑的、可重用的修复策略,并将其转为最小的代码补丁,从而在上下文长度有限的7B模型上实现哥德尔智能体的递归演化,这种减少上下文消耗的方式,不仅适用于小模型,对于未来用长上下文的SOTA求解更复杂的问题,或将也有帮助。同时Polaris每一次改进都被记录为具体的“诊断-策略-补丁”链条,其演化过程是透明且可追溯的,这为构建安全、可控的递归进化智能体提供了工具。
小结
原始哥德尔机给出了优雅但几乎不可实现的最优自我改进范式。之后哥德尔智能体首次给出其现实近似,HGM引入 进化支避免忽视改进潜力,RQGM 则进一步扩展到多智能体对抗式共进化,实现了在论文写作这样无固定客观标准的领域里进行自我改进。
而笔者设想,或可借鉴免疫系统,进一步通过引入人工免疫系统改进RQGM,例如在评估器中加入抗原,例如智能体的核心安全协议、系统架构约束,而评估器发现后续修改即试图篡改核心规则时,则阻止该修改,这样的策略能解决哥德尔机的由于自进化带来的对齐和安全问题。抗原也可以根据大模型推理时的动力学特征来进行判定,例如,将呈现出异常流形的推理案例加入抗原,这样引入人工免疫的RQGM,将更适合关注安全的场景,例如金融,医疗,或者要求慢演化但要稳定的科学发现系统。
参考资料
1 https://cis.temple.edu/tagit/presentations/Huxley-Godel%20Machine.pdf
2 https://arxiv.org/abs/2410.04444
3 https://arxiv.org/abs/2510.21614
4 https://ai.meta.com/research/publications/hyperagents/
5 https://arxiv.org/abs/2601.03335
6 https://arxiv.org/abs/2603.23129
后ChatGPT读书会——“意识机器”初探
从 AlphaGo 到 ChatGPT,随着人类智能一个个被机器算法突破,人们不禁开始思考:还有什么能力是人类具备而人工智能尚无法取代的?自我意识就是一个关键的未被突破的能力,它不仅可以对自我的行为进行深度反思从而跳出循环,形成顿悟,还能够给主体带来真正的主观体验。那么,自我意识的本质是什么?ChatGPT 是否能够拥有自我意识?本视频提出了一种自我意识的最小模型,它可以一定程度上解释人类意识的特点,也可能找到判定机器是否具有意识的一种标准。
集智俱乐部特别组织,由北师大教授、集智俱乐部创始人张江老师联合肖达、李嫣然、崔鹏、侯月源、钟翰廷、卢燚等多位老师共同发起,旨在系统性地梳理ChatGPT技术,并发现其弱点与短板。读书会已完结,现在报名可加入社群并解锁 回放 视频权限。
详情请见:
1.
2.
3.
4.
5.
6.
7.
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.