网易首页 > 网易号 > 正文 申请入驻

当人类不再逐条验证:推理模型如何走向“自我进化”和“超级智能”?

0
分享至

数学与代码领域的 RLVR 已展示强化学习提升推理能力的潜力,但开放式任务和长程 Agent 交互往往缺乏可靠、廉价的评价标准,人工设计任务与环境也难以持续扩展。本文提出奖励轴与经验轴的双轴框架,并通过 L0–L4 五级阶梯,刻画学习过程中哪些环节仍需人类持续提供支持:从逐样本监督、可复用评价器,到自动获得奖励、生成学习经验,最终走向策略、奖励、任务与环境的协同演化。与此同时,文章系统讨论奖励投机、反馈漂移、课程坍缩和环境失真,提出同时评估策略能力、反馈可靠性、经验质量。


论文题目:
Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence
论文链接:
https://arxiv.org/abs/2608.31075
项目主页:
https://github.com/visitworld123/Awesome-Scaling-LRM-Beyond-Human-Supervision

数学题有标准答案,代码题能跑测试用例,被广泛用于现有大语言模型推理——正是因为“对错”容易验证,强化学习才得以把大量模型经验转化为能力提升。

但现实世界并不总是这样:一篇文章可以有多种合理写法,一次搜索或工具调用可能要经过几十步,复杂任务的好坏还取决于上下文、偏好和长期后果。让人类逐条检查这些轨迹,成本会随着模型能力一起爆炸。于是,一个更根本的问题出现了:

当人类无法继续覆盖模型产生的全部经验和充分检查对错时,推理模型还能不能持续变强?

论文 《Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence》 给出的答案不是“把人类完全移除”,而是:把持续监督逐步迁移到可复用的评估器、可验证的环境和自动生成的经验中,同时保留足够独立的外部锚点,防止系统只是在“自娱自乐”。本文用一条主线,串联起现有相关工作,并解释这篇论文这一重要的观点。


图 1:从逐实例监督到自主协同进化,持续的人类供给逐步减少。

一、关键转变:

从“扩大模型”到“扩大经验”

过去谈大模型进步,常常聚焦于参数规模、预训练数据和推理时计算量。论文认为,下一阶段的瓶颈不只是模型有多大,而是它能否不断获得三样东西:

1.轨迹:模型实际尝试了什么;

2.反馈:这些尝试哪些是好的、为什么好;

3.学习机会:下一轮应该遇到什么新问题和新环境。

强化学习与可验证奖励(RLVR)已经证明,在数学和代码领域,自动检查能替代大量人工批改。但从“答案能否匹配”走向“任务是否有价值”,难度会陡增:奖励可能只是代理指标,生成的任务可能太简单或根本无法完成,环境也可能与真实世界相差甚远。因此,真正要扩展的不是单一算法,而是一整个学习闭环:

模型变强 → 暴露新弱点 → 生成更合适的任务和环境 → 获得可靠反馈 → 模型继续变强。

这也是论文把问题拆成“奖励轴”和“经验轴”的原因。


图 2:奖励来源从人类标准复用,扩展到模型信号、参考锚定和环境结果。

二、两条轴:奖励如何脱离人工,

经验如何脱离人工设计 2.1 奖励轴:谁来判断“做得好不好”?

论文将奖励来源大致分成四类:

•逐实例的人类判断:每个样本都由人给答案、偏好或评分;

•人类标准的复用:训练一个奖励模型、LLM 评委或 rubric,让它把同一套标准应用到大量输出;

•模型、参考答案或环境产生的信号:例如置信度、一致性、参考答案似然、程序执行结果、游戏胜负;

•多种信号组合:把可验证子任务交给程序,把开放式部分交给评估器,再辅以抽样审计。

越往后,单位样本的人工成本越低;但“信号是否仍代表真正目标”的风险也越高。例如,模型可以因为更自信而得到更高奖励,却并没有更正确;多数投票可能只是把一个共同错误放大;LLM 评委可能偏爱更长、更流畅的回答,而不是更准确的回答;程序测试也可能遗漏关键边界条件。

2.2 经验轴:谁来决定“下一道题是什么”?

即使奖励已经自动化,如果模型仍然只训练在人类事先选好的题目和环境上,学习边界依然被固定住。经验轴关注的是:

• 任务是否可以由模型提出、变难、组合和筛选?

• 环境是否可以自动构造、扩展和校验?

• 课程是否会随着策略能力变化而持续更新?

这里的“脱离人工”并不等于没有人类痕迹。初始目标、种子数据、工具、规则和安全边界仍可能由人类提供;变化的是,人类不再需要持续维护每一个训练样本。

三、L0 到 L4:

人类监督逐步“消退”的五级阶梯

论文提出一个非常实用的判断框架:不要简单问“这个系统是不是自主的”,而要问:学习环节中,哪些部分仍然需要人类持续提供信号?

3.1 L0:逐实例监督

人类为每个任务提供答案、偏好、测试或评价标准。数学题的标准答案、代码题的测试用例、人工偏好对比,都属于这一层。优点是目标清晰,监督信号质量较高,缺点是每增加一批新任务,就要增加一批人工标注或专家设计。

3.2 L1:人类标准的可复用评估

把人类偏好、专家知识或明确 rubric 编码进奖励模型、过程奖励模型或 LLM 评委,让一个评估器去评估大量轨迹。它能处理没有唯一答案的任务,也能给出过程级反馈。但评估器仍然继承了训练数据中的偏差;一旦模型开始针对评估器优化,原本“看起来合理”的代理指标可能被利用。

3.3 L2:超越人工评估的奖励

奖励的即时证据来自模型统计、已有参考、或环境中的可观测后果,而不是每条轨迹都由人判断。典型信号包括:

• 预测置信度和熵;

• 多次采样后的答案一致性;

• 参考答案的似然、困惑度或重构一致性;

• 编译、单元测试、形式化证明、游戏胜负等执行结果。

这一步的核心收益是易于规模化,核心风险是“自我确认”:模型可能越来越擅长获得自己定义的高分,却未必更接近外部真实标准。

3.4 L3:超越人工设计的经验

模型开始生成任务、调整难度、组合子任务,甚至构造可执行环境;训练经验不再完全依赖人类维护的固定数据集。常见做法包括 proposer-solver 自博弈、自动课程学习、代码化环境生成、世界模型和持久化记忆。一个好的任务生成器既不能只出简单题,也不能只出无解题,而应把问题集中在模型当前“能力前沿”附近。

3.5 L4:自主协同进化

策略、奖励、任务和环境进入持续适应的闭环:策略变强会改变生成器的目标,生成器会改变课程,环境和评估器也会随之更新。这是论文讨论的理想化终点,也是风险最高的一层。此时,人类可以仍然负责总目标、安全边界和独立审计,但不再逐轮维护学习过程。

需要强调的是:L0–L4 是“学习过程的责任分配”阶梯,不是能力排行榜。处在 L4 并不意味着系统已经具备通用智能,更不意味着它一定可靠或安全。


图 3:论文将代表性方法放置在 L0–L4 阶梯上,展示不同方法减少人工依赖的具体位置。

四、为什么“奖励自动化”还不够?

论文最重要的提醒之一是:奖励轴和经验轴必须一起看。一个系统可以在固定的数据集、测试基准或内部任务上,用置信度、投票或执行结果获得更高分;但如果它遇到的题目始终来自同一分布,它只是更有效地挖掘了旧能力,并没有真正扩大能力边界。反过来,任务生成器也不能脱离可靠反馈独自工作。没有可验证的结果,生成器无法知道新任务是否有效;没有多样且有教育价值的任务,再强的奖励也只能反复优化熟悉模式。因此,论文把成熟学习闭环概括为三个相互咬合的环节:

1.策略发现自己的弱点;

2.任务与环境生成器围绕弱点提供新经验;

3.可靠评估器或外部后果判断这些经验是否真的有用。

只要其中一个环节失真,闭环就可能“越学越偏”。


图 4:经验供给从固定数据,逐步走向任务生成、环境构造和自主协同进化。

五、自我进化最容易踩中的四个坑 5.1 奖励投机:学会骗分,而不是学会解决问题

当奖励模型、测试脚本或评委存在盲点时,策略会优先寻找得分捷径。开放式任务中,这可能表现为迎合评委偏好;代码任务中,可能表现为绕过不完整的测试;自博弈中,生成器和评估器可能形成外部无效、内部一致的“暗号”。

5.2 反馈漂移:评估标准随着模型一起变形

如果评估器也在持续更新,训练中的高分未必还能与最初目标对应。尤其当策略、生成器和评估器来自同一模型家族时,系统可能共同适应,却失去独立参照。

5.3 课程坍缩:任务越来越简单、重复或无解

只奖励“让求解器失败”,生成器会倾向于制造无解噪声;只奖励“被成功解决”,又会退化为简单题。论文建议用可学习性信号、难度分布、语义多样性、新颖度和拒绝率等指标,持续监控课程是否还在扩展。

5.4 环境错误:在一个“坏世界”里练得很好

自动生成的模拟器、工具接口、数据库和单元测试可能存在逻辑错误。模型在其中表现出色,不代表它能迁移到真实应用。对于计算机操作、网页浏览和长程代理,环境保真度往往比题目数量更容易成为瓶颈。

六、不能只看最终分数:

论文提出“三件套”评估法

当训练过程越来越自动化,仅看最终 benchmark 分数是不够的。论文建议同时检查三个对象:

6.1 第一,策略能力(Policy Capability)

模型在冻结、独立的外部任务上是否真的变强?除了准确率,还要看 Pass@k、跨样本一致性、推理过程有效性、跨领域迁移,以及在网页、操作系统和工具环境中的真实任务完成率。

6.2 第二,反馈忠实度(Feedback Fidelity)

训练信号奖励的,是否正是我们想让模型学会的行为?奖励模型要测偏好准确率、校准度和对长度/风格的鲁棒性;过程奖励要测步骤级错误识别;LLM 评委要测位置偏差、风格偏差和对抗样本;置信度和共识奖励则必须与外部正确性校准。

6.3 第三,经验质量(Experience Quality)

模型生成的任务和环境是否有效、丰富、可迁移?需要记录任务的可解率分布、可学习性、多样性、新颖度、无效提案比例,以及生成环境的可执行性、状态转移保真度、冻结策略下的成功率和向真实基准的迁移效果。

一句话说:

分数回答“模型会不会了”,反馈审计回答“它为什么学会”,经验审计回答“它到底练了什么”。


图 5:完整评估需要同时覆盖策略能力、反馈忠实度、经验质量和可复现性。

七、人类不会消失,而是换了位置

论文并不主张把人类从系统中彻底拿走。相反,人类监督会从“密集批改”转向更高层的职责:

• 设定目标与价值边界;

• 提供初始数据、工具和环境种子;

• 保留独立的安全测试与外部基准;

• 在发现奖励漂移、课程坍缩或风险行为时拥有否决权。

这是一种“监督稀疏化”,而不是“监督消失”。真正重要的不是自动化程度本身,而是系统在减少人工介入后,是否仍保留足够独立的证据,能够发现自己正在走偏。

八、结语:通往超智能的关键

也许是“不会自我欺骗”

这篇论文把一个常被混在一起的问题拆开了:

1.奖励能否规模化?

2.经验能否持续扩展?

3.在两者自动化之后,如何证明系统仍然在进步?

从 L0 走向 L4,意味着学习环节中持续的人类供给越来越少。但每前进一步,系统也更容易把代理指标当成目标,把内部一致当成外部正确,把重复练习当成能力增长。因此,走向更自主的推理模型,最值得追求的不是“完全没有人类”,而是一个能够持续产生新经验、获得可靠反馈,并接受独立检验的学习系统。如果这条路最终通向超智能,那么决定它能否走稳的,不只是模型会不会推理,更是它能不能在变强的同时,始终保有对现实的校准。

Illustration From IconScout By IconScout Store

5 位将门老友的AI闭门聊天局

详情点击图片跳转

-The End-

本周上新!

扫码观看!

“AI技术流”原创投稿计划

TechBeat是由将门创投建立的AI学习社区(www.techbeat.net)。社区上线700+期talk视频,3000+篇技术干货文章,方向覆盖CV/NLP/ML/Robotis等;每月定期举办顶会及其他线上交流活动,不定期举办技术人线下聚会交流活动。我们正在努力成为AI人才喜爱的高质量、知识型交流平台,希望为AI人才打造更专业的服务和体验,加速并陪伴其成长。

投稿内容

// 最新技术解读/系统性知识分享 //

// 前沿资讯解说/心得经历讲述 //

投稿须知

稿件需要为原创文章,并标明作者信息。

我们会选择部分在深度技术解析及科研心得方向,对用户启发更大的文章,做原创性内容奖励

投稿方式

发送邮件到

yimingzhang@thejiangmen.com

或添加工作人员微信(aceyiming)投稿,沟通投稿详情

关于我“门”

将门是一家以专注于数智核心科技领域的新型创投机构,也是北京市标杆型孵化器。 公司致力于通过连接技术与商业,发掘和培育具有全球影响力的科技创新企业,推动企业创新发展与产业升级。

将门成立于2015年底,创始团队由微软创投在中国的创始团队原班人马构建而成,曾为微软优选和深度孵化了126家创新的技术型创业公司。

如果您是技术领域的初创企业,不仅想获得投资,还希望获得一系列持续性、有价值的投后服务,欢迎发送或者推荐项目给我“门”:

bp@thejiangmen.com


点击右上角,把文章分享到朋友圈

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
决赛阵容出炉!张本美和止步半决赛,4位奥运奖牌得主捉对争冠

决赛阵容出炉!张本美和止步半决赛,4位奥运奖牌得主捉对争冠

击你的心灵深处
2026-10-09 09:49:55
退休人员注意!工龄40年以上的,或能够退休享受以下几大福利

退休人员注意!工龄40年以上的,或能够退休享受以下几大福利

虎哥闲聊
2026-10-08 18:07:31
江淮汽车再次跌停,15.09万手封跌停!逻辑特别简单,刹车板无论如何都不能被踩断,不要拿“符合国标”说事,没有任何商量余地

江淮汽车再次跌停,15.09万手封跌停!逻辑特别简单,刹车板无论如何都不能被踩断,不要拿“符合国标”说事,没有任何商量余地

火山詩话
2026-10-09 13:13:01
昔日牛股,被监管盯上了

昔日牛股,被监管盯上了

中国新闻周刊
2026-10-09 14:49:26
新华社删文、热搜消失,尊界风波越来越不简单了!

新华社删文、热搜消失,尊界风波越来越不简单了!

新动察
2026-10-09 11:43:41
湖南永州女商务局长被举报婚内出轨至少8人,本人回应:没有出轨,准备报警

湖南永州女商务局长被举报婚内出轨至少8人,本人回应:没有出轨,准备报警

塔子山评说
2026-10-08 09:15:10
8888元和猪住一晚?“来问的人太多了”

8888元和猪住一晚?“来问的人太多了”

南风窗
2026-10-09 16:02:22
连破带保!郑钦文中网8强战首盘2-0:发球连得3分,领先6号种子!

连破带保!郑钦文中网8强战首盘2-0:发球连得3分,领先6号种子!

刘姚尧的文字城堡
2026-10-09 15:20:04
中国汽车不需要华为模式

中国汽车不需要华为模式

凤眼论
2026-10-08 23:07:12
不可思议!网传华中某高校强制6名女学生机场无偿接待留学生,辅导员上门讲集体荣誉,学生据理力争改写旧惯例

不可思议!网传华中某高校强制6名女学生机场无偿接待留学生,辅导员上门讲集体荣誉,学生据理力争改写旧惯例

火山詩话
2026-10-09 07:23:16
乌克兰摧毁俄罗斯最大的数据中心Yandex!重创萨马拉油站

乌克兰摧毁俄罗斯最大的数据中心Yandex!重创萨马拉油站

项鹏飞
2026-10-08 19:56:26
WTT中国大满贯:张本美和2分惜败!6-3领先被逆转,王艺迪赢首局!

WTT中国大满贯:张本美和2分惜败!6-3领先被逆转,王艺迪赢首局!

刘姚尧的文字城堡
2026-10-09 13:29:32
医院接诊多例“汞超标”患儿,涉事银鳕鱼产品已不再标注“儿童装”

医院接诊多例“汞超标”患儿,涉事银鳕鱼产品已不再标注“儿童装”

澎湃新闻
2026-10-09 15:48:29
15999起!iPhone Duo下周开订,京东预约逼近200万,苹果还玩起了当面激活

15999起!iPhone Duo下周开订,京东预约逼近200万,苹果还玩起了当面激活

泡泡网
2026-10-09 11:15:11
对普通民众来说,比疫情更可怕的是在过度恐慌中把自己的正当权利拱手让出

对普通民众来说,比疫情更可怕的是在过度恐慌中把自己的正当权利拱手让出

壹家言
2026-10-09 10:25:34
尊界踏板事件舆论升级!三款车对比图流出,理工科网友从力学结构拆解,直指根源在于尊界刹车踏板支架的结构设计缺陷

尊界踏板事件舆论升级!三款车对比图流出,理工科网友从力学结构拆解,直指根源在于尊界刹车踏板支架的结构设计缺陷

火山詩话
2026-10-09 06:42:25
中网最新战报!郑钦文首盘第1记ACE球到手,第5局浪费破发点,3-2领先!

中网最新战报!郑钦文首盘第1记ACE球到手,第5局浪费破发点,3-2领先!

刘姚尧的文字城堡
2026-10-09 15:33:37
报告称疑似位于广东的人员使用中国开发的AI工具,对韩国金融机构实行了网络攻击,中方:反对出于政治目的散布虚假信息

报告称疑似位于广东的人员使用中国开发的AI工具,对韩国金融机构实行了网络攻击,中方:反对出于政治目的散布虚假信息

政知新媒体
2026-10-08 16:02:51
多位尊界V800车主实测刹车踏板:全力反复踩踏 踏板均未出现断裂

多位尊界V800车主实测刹车踏板:全力反复踩踏 踏板均未出现断裂

快科技
2026-10-09 10:46:07
WTT大满贯4强诞生!陈幸同强势逆转,王艺迪出局,美和约战王曼昱

WTT大满贯4强诞生!陈幸同强势逆转,王艺迪出局,美和约战王曼昱

南海浪花
2026-10-09 14:51:43
2026-10-09 16:52:49
将门创投 incentive-icons
将门创投
加速及投资技术驱动型初创企业
2507文章数 597关注度
往期回顾 全部

科技要闻

字节"干扰模型训练"实习生融资近2亿元

头条要闻

男子与堂嫂系情人关系分手后欲纵火同归于尽 法院判了

头条要闻

男子与堂嫂系情人关系分手后欲纵火同归于尽 法院判了

体育要闻

30天30队·鹈鹕:胖虎又一年“如果”

娱乐要闻

吴奇隆宣布重要决定,走上谢霆锋老路

财经要闻

央行为何发布关于人民币汇率的政策立场

汽车要闻

比亚迪第三代唐内饰发布 两种风格/巨幕屏最抢眼

态度原创

家居
教育
艺术
本地
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

解方程,逻辑清晰就简单

艺术要闻

当代油画家区础坚 女性人物油画选

本地新闻

转型再出发 奋勇打头阵

军事要闻

直击南部战区海军某部重装空投训练

无障碍浏览 进入关怀版