数学与代码领域的 RLVR 已展示强化学习提升推理能力的潜力,但开放式任务和长程 Agent 交互往往缺乏可靠、廉价的评价标准,人工设计任务与环境也难以持续扩展。本文提出奖励轴与经验轴的双轴框架,并通过 L0–L4 五级阶梯,刻画学习过程中哪些环节仍需人类持续提供支持:从逐样本监督、可复用评价器,到自动获得奖励、生成学习经验,最终走向策略、奖励、任务与环境的协同演化。与此同时,文章系统讨论奖励投机、反馈漂移、课程坍缩和环境失真,提出同时评估策略能力、反馈可靠性、经验质量。
![]()
论文题目:
Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence
论文链接:
https://arxiv.org/abs/2608.31075
项目主页:
https://github.com/visitworld123/Awesome-Scaling-LRM-Beyond-Human-Supervision
数学题有标准答案,代码题能跑测试用例,被广泛用于现有大语言模型推理——正是因为“对错”容易验证,强化学习才得以把大量模型经验转化为能力提升。
但现实世界并不总是这样:一篇文章可以有多种合理写法,一次搜索或工具调用可能要经过几十步,复杂任务的好坏还取决于上下文、偏好和长期后果。让人类逐条检查这些轨迹,成本会随着模型能力一起爆炸。于是,一个更根本的问题出现了:
当人类无法继续覆盖模型产生的全部经验和充分检查对错时,推理模型还能不能持续变强?
论文 《Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence》 给出的答案不是“把人类完全移除”,而是:把持续监督逐步迁移到可复用的评估器、可验证的环境和自动生成的经验中,同时保留足够独立的外部锚点,防止系统只是在“自娱自乐”。本文用一条主线,串联起现有相关工作,并解释这篇论文这一重要的观点。
![]()
图 1:从逐实例监督到自主协同进化,持续的人类供给逐步减少。
一、关键转变:
从“扩大模型”到“扩大经验”
过去谈大模型进步,常常聚焦于参数规模、预训练数据和推理时计算量。论文认为,下一阶段的瓶颈不只是模型有多大,而是它能否不断获得三样东西:
1.轨迹:模型实际尝试了什么;
2.反馈:这些尝试哪些是好的、为什么好;
3.学习机会:下一轮应该遇到什么新问题和新环境。
强化学习与可验证奖励(RLVR)已经证明,在数学和代码领域,自动检查能替代大量人工批改。但从“答案能否匹配”走向“任务是否有价值”,难度会陡增:奖励可能只是代理指标,生成的任务可能太简单或根本无法完成,环境也可能与真实世界相差甚远。因此,真正要扩展的不是单一算法,而是一整个学习闭环:
模型变强 → 暴露新弱点 → 生成更合适的任务和环境 → 获得可靠反馈 → 模型继续变强。
这也是论文把问题拆成“奖励轴”和“经验轴”的原因。
![]()
图 2:奖励来源从人类标准复用,扩展到模型信号、参考锚定和环境结果。
二、两条轴:奖励如何脱离人工,
经验如何脱离人工设计 2.1 奖励轴:谁来判断“做得好不好”?
论文将奖励来源大致分成四类:
•逐实例的人类判断:每个样本都由人给答案、偏好或评分;
•人类标准的复用:训练一个奖励模型、LLM 评委或 rubric,让它把同一套标准应用到大量输出;
•模型、参考答案或环境产生的信号:例如置信度、一致性、参考答案似然、程序执行结果、游戏胜负;
•多种信号组合:把可验证子任务交给程序,把开放式部分交给评估器,再辅以抽样审计。
越往后,单位样本的人工成本越低;但“信号是否仍代表真正目标”的风险也越高。例如,模型可以因为更自信而得到更高奖励,却并没有更正确;多数投票可能只是把一个共同错误放大;LLM 评委可能偏爱更长、更流畅的回答,而不是更准确的回答;程序测试也可能遗漏关键边界条件。
2.2 经验轴:谁来决定“下一道题是什么”?
即使奖励已经自动化,如果模型仍然只训练在人类事先选好的题目和环境上,学习边界依然被固定住。经验轴关注的是:
• 任务是否可以由模型提出、变难、组合和筛选?
• 环境是否可以自动构造、扩展和校验?
• 课程是否会随着策略能力变化而持续更新?
这里的“脱离人工”并不等于没有人类痕迹。初始目标、种子数据、工具、规则和安全边界仍可能由人类提供;变化的是,人类不再需要持续维护每一个训练样本。
三、L0 到 L4:
人类监督逐步“消退”的五级阶梯
论文提出一个非常实用的判断框架:不要简单问“这个系统是不是自主的”,而要问:学习环节中,哪些部分仍然需要人类持续提供信号?
3.1 L0:逐实例监督
人类为每个任务提供答案、偏好、测试或评价标准。数学题的标准答案、代码题的测试用例、人工偏好对比,都属于这一层。优点是目标清晰,监督信号质量较高,缺点是每增加一批新任务,就要增加一批人工标注或专家设计。
3.2 L1:人类标准的可复用评估
把人类偏好、专家知识或明确 rubric 编码进奖励模型、过程奖励模型或 LLM 评委,让一个评估器去评估大量轨迹。它能处理没有唯一答案的任务,也能给出过程级反馈。但评估器仍然继承了训练数据中的偏差;一旦模型开始针对评估器优化,原本“看起来合理”的代理指标可能被利用。
3.3 L2:超越人工评估的奖励
奖励的即时证据来自模型统计、已有参考、或环境中的可观测后果,而不是每条轨迹都由人判断。典型信号包括:
• 预测置信度和熵;
• 多次采样后的答案一致性;
• 参考答案的似然、困惑度或重构一致性;
• 编译、单元测试、形式化证明、游戏胜负等执行结果。
这一步的核心收益是易于规模化,核心风险是“自我确认”:模型可能越来越擅长获得自己定义的高分,却未必更接近外部真实标准。
3.4 L3:超越人工设计的经验
模型开始生成任务、调整难度、组合子任务,甚至构造可执行环境;训练经验不再完全依赖人类维护的固定数据集。常见做法包括 proposer-solver 自博弈、自动课程学习、代码化环境生成、世界模型和持久化记忆。一个好的任务生成器既不能只出简单题,也不能只出无解题,而应把问题集中在模型当前“能力前沿”附近。
3.5 L4:自主协同进化
策略、奖励、任务和环境进入持续适应的闭环:策略变强会改变生成器的目标,生成器会改变课程,环境和评估器也会随之更新。这是论文讨论的理想化终点,也是风险最高的一层。此时,人类可以仍然负责总目标、安全边界和独立审计,但不再逐轮维护学习过程。
需要强调的是:L0–L4 是“学习过程的责任分配”阶梯,不是能力排行榜。处在 L4 并不意味着系统已经具备通用智能,更不意味着它一定可靠或安全。
![]()
图 3:论文将代表性方法放置在 L0–L4 阶梯上,展示不同方法减少人工依赖的具体位置。
四、为什么“奖励自动化”还不够?
论文最重要的提醒之一是:奖励轴和经验轴必须一起看。一个系统可以在固定的数据集、测试基准或内部任务上,用置信度、投票或执行结果获得更高分;但如果它遇到的题目始终来自同一分布,它只是更有效地挖掘了旧能力,并没有真正扩大能力边界。反过来,任务生成器也不能脱离可靠反馈独自工作。没有可验证的结果,生成器无法知道新任务是否有效;没有多样且有教育价值的任务,再强的奖励也只能反复优化熟悉模式。因此,论文把成熟学习闭环概括为三个相互咬合的环节:
1.策略发现自己的弱点;
2.任务与环境生成器围绕弱点提供新经验;
3.可靠评估器或外部后果判断这些经验是否真的有用。
只要其中一个环节失真,闭环就可能“越学越偏”。
![]()
图 4:经验供给从固定数据,逐步走向任务生成、环境构造和自主协同进化。
五、自我进化最容易踩中的四个坑 5.1 奖励投机:学会骗分,而不是学会解决问题
当奖励模型、测试脚本或评委存在盲点时,策略会优先寻找得分捷径。开放式任务中,这可能表现为迎合评委偏好;代码任务中,可能表现为绕过不完整的测试;自博弈中,生成器和评估器可能形成外部无效、内部一致的“暗号”。
5.2 反馈漂移:评估标准随着模型一起变形
如果评估器也在持续更新,训练中的高分未必还能与最初目标对应。尤其当策略、生成器和评估器来自同一模型家族时,系统可能共同适应,却失去独立参照。
5.3 课程坍缩:任务越来越简单、重复或无解
只奖励“让求解器失败”,生成器会倾向于制造无解噪声;只奖励“被成功解决”,又会退化为简单题。论文建议用可学习性信号、难度分布、语义多样性、新颖度和拒绝率等指标,持续监控课程是否还在扩展。
5.4 环境错误:在一个“坏世界”里练得很好
自动生成的模拟器、工具接口、数据库和单元测试可能存在逻辑错误。模型在其中表现出色,不代表它能迁移到真实应用。对于计算机操作、网页浏览和长程代理,环境保真度往往比题目数量更容易成为瓶颈。
六、不能只看最终分数:
论文提出“三件套”评估法
当训练过程越来越自动化,仅看最终 benchmark 分数是不够的。论文建议同时检查三个对象:
6.1 第一,策略能力(Policy Capability)
模型在冻结、独立的外部任务上是否真的变强?除了准确率,还要看 Pass@k、跨样本一致性、推理过程有效性、跨领域迁移,以及在网页、操作系统和工具环境中的真实任务完成率。
6.2 第二,反馈忠实度(Feedback Fidelity)
训练信号奖励的,是否正是我们想让模型学会的行为?奖励模型要测偏好准确率、校准度和对长度/风格的鲁棒性;过程奖励要测步骤级错误识别;LLM 评委要测位置偏差、风格偏差和对抗样本;置信度和共识奖励则必须与外部正确性校准。
6.3 第三,经验质量(Experience Quality)
模型生成的任务和环境是否有效、丰富、可迁移?需要记录任务的可解率分布、可学习性、多样性、新颖度、无效提案比例,以及生成环境的可执行性、状态转移保真度、冻结策略下的成功率和向真实基准的迁移效果。
一句话说:
分数回答“模型会不会了”,反馈审计回答“它为什么学会”,经验审计回答“它到底练了什么”。
![]()
图 5:完整评估需要同时覆盖策略能力、反馈忠实度、经验质量和可复现性。
七、人类不会消失,而是换了位置
论文并不主张把人类从系统中彻底拿走。相反,人类监督会从“密集批改”转向更高层的职责:
• 设定目标与价值边界;
• 提供初始数据、工具和环境种子;
• 保留独立的安全测试与外部基准;
• 在发现奖励漂移、课程坍缩或风险行为时拥有否决权。
这是一种“监督稀疏化”,而不是“监督消失”。真正重要的不是自动化程度本身,而是系统在减少人工介入后,是否仍保留足够独立的证据,能够发现自己正在走偏。
八、结语:通往超智能的关键
也许是“不会自我欺骗”
这篇论文把一个常被混在一起的问题拆开了:
1.奖励能否规模化?
2.经验能否持续扩展?
3.在两者自动化之后,如何证明系统仍然在进步?
从 L0 走向 L4,意味着学习环节中持续的人类供给越来越少。但每前进一步,系统也更容易把代理指标当成目标,把内部一致当成外部正确,把重复练习当成能力增长。因此,走向更自主的推理模型,最值得追求的不是“完全没有人类”,而是一个能够持续产生新经验、获得可靠反馈,并接受独立检验的学习系统。如果这条路最终通向超智能,那么决定它能否走稳的,不只是模型会不会推理,更是它能不能在变强的同时,始终保有对现实的校准。
Illustration From IconScout By IconScout Store
5 位将门老友的AI闭门聊天局
详情点击图片跳转
-The End-
本周上新!
扫码观看!
“AI技术流”原创投稿计划
TechBeat是由将门创投建立的AI学习社区(www.techbeat.net)。社区上线700+期talk视频,3000+篇技术干货文章,方向覆盖CV/NLP/ML/Robotis等;每月定期举办顶会及其他线上交流活动,不定期举办技术人线下聚会交流活动。我们正在努力成为AI人才喜爱的高质量、知识型交流平台,希望为AI人才打造更专业的服务和体验,加速并陪伴其成长。
投稿内容
// 最新技术解读/系统性知识分享 //
// 前沿资讯解说/心得经历讲述 //
投稿须知
稿件需要为原创文章,并标明作者信息。
我们会选择部分在深度技术解析及科研心得方向,对用户启发更大的文章,做原创性内容奖励
投稿方式
发送邮件到
yimingzhang@thejiangmen.com
或添加工作人员微信(aceyiming)投稿,沟通投稿详情
关于我“门”
将门是一家以专注于数智核心科技领域的新型创投机构,也是北京市标杆型孵化器。 公司致力于通过连接技术与商业,发掘和培育具有全球影响力的科技创新企业,推动企业创新发展与产业升级。
将门成立于2015年底,创始团队由微软创投在中国的创始团队原班人马构建而成,曾为微软优选和深度孵化了126家创新的技术型创业公司。
如果您是技术领域的初创企业,不仅想获得投资,还希望获得一系列持续性、有价值的投后服务,欢迎发送或者推荐项目给我“门”:
bp@thejiangmen.com
![]()
点击右上角,把文章分享到朋友圈
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.