网易首页 > 网易号 > 正文 申请入驻

杨立昆《On Training in Imagination》:与其在世界中试错,不如在想象中训练

0
分享至

来源:市场资讯

(来源:图灵人工智能)

这不是一篇普通的强化学习技术论文。杨立昆团队 对 "智能究竟是什么" 这一根本问题的系统性思考,更是一场从 "数据拟合" 到 "思维生成" 的认知范式革命。作者是 Nadav Timor、Ravid Shwartz-Ziv、Micah Goldblum、Yann LeCun、David Harel

https://arxiv.org/abs/2605.06732


问题一:为什么智能不能只靠真实经验学习?

绝大多数 AI 研究者都默认了一个未经审视的假设:智能是对经验的统计归纳。只要给模型足够多的真实世界数据,让它在足够多的试错中学习,最终就能涌现出智能。但杨立昆一针见血地指出:人类智能的绝大多数知识,从来都不是来自真实试错。

人类并不是每件事都亲自试一遍。我们不会真的把车开向墙壁来学习碰撞后果,也不会真的把每一种人生选择都执行一遍。我们大量依赖一种能力:在内心模拟可能发生的事,然后选择行动。

这就是这篇论文标题中 “imagination” 的真正含义。它不是浪漫意义上的幻想,而是强化学习中的一个技术范式:策略不直接在真实环境里更新,而是在一个学到的动力学模型中生成 imagined rollouts,再由学到的奖励模型对这些轨迹打分。

论文明确说,在这种范式中,策略更新阶段不再查询真实环境。

所以第一个认知转折是:智能并不只是从经验中学习,而是用经验建造一个可反复试错的内部世界。

真实世界太贵、太慢、太危险;想象世界便宜、快速、可重复。AI 如果能在内部世界里训练,就可以把少量真实经验放大成大量虚拟经验。

问题二:所谓“想象”,到底想象了什么?

论文中的想象不是单一模块,而是由两个东西组成:

第一,世界会如何变化。

这对应 learned dynamics model,也就是动力学模型。它回答:“如果我在这个状态下做这个动作,接下来会发生什么?”

第二,发生的事情好不好。

这对应 learned reward model,也就是奖励模型。它回答:“这个结果值得追求吗?”

这点非常关键。一个智能体不是只需要预测未来,还需要评价未来。只知道“会发生什么”,但不知道“值不值得”,它无法选择;只知道“想要什么”,但不知道“怎么到达”,它也无法行动。论文正是把 learned dynamics 和 learned reward 同时放进 training in imagination 的框架中分析。

所以第二个认知转折是:

想象不是单纯的预测,而是“预测未来 + 评价未来”。

这也让“智能”从感知问题变成了一个更深的问题:

AI 不只是要看见世界,而是要在内部生成世界;不只是要生成世界,还要知道哪些世界更值得抵达。

问题三:如果 AI 在自己的想象中训练,最可怕的错误是什么?

直觉上,我们会说:当然是世界模型错了。

比如智能体以为悬崖前还有路,于是在想象中大胆前进,现实中却摔下去。但论文指出另一类同样危险、甚至更隐蔽的错误:奖励模型错了。

动力学模型错,是“我误判了世界会怎样”。

奖励模型错,是“我误判了什么是好”。

前者让 AI 走错路,后者让 AI 追错目标。

论文的第一个主要贡献就是把 return gap 拆成两个可分别控制的来源:dynamics-model error 和 reward-model error。以前一些 simulation-lemma-style 分析没有给这两类误差分别分配独立系数,也没有告诉我们预算该投给动力学样本还是奖励样本;这篇论文正是要把这件事理论化。

这里的深层问题是:

一个智能体失败,究竟是因为它不理解世界,还是因为它误解了价值?

这比“模型准不准”更深。因为一个高度聪明但价值判断偏差的系统,可能比一个能力较弱的系统更危险。它不是不知道怎么到达目标,而是目标本身已经被内部奖励模型扭曲了。

问题四:为什么一点点想象误差会毁掉整个未来?

如果只预测一步,模型稍微错一点也许没关系。

但 training in imagination 的关键在于 rollout:一步接一步,一直往未来推演。

这时问题变成:小错误会不会在时间中滚雪球?

论文用 Lipschitz 常数来刻画这个问题。直观地说,如果一个模型的 Lipschitz 常数很大,就意味着输入状态一点点变化,输出可能剧烈变化。这样的内部世界是不稳定的:一个微小偏差,经过多步想象后,可能变成完全不同的未来。

论文指出,较低的 dynamics、reward 和 policy 的 Lipschitz 常数,可以收紧 return-error bound;也就是说,更平滑、更稳定的内部表征,会让想象轨迹更可靠。

这带来第三个认知转折:

好的世界模型不只是准确,而是稳定。

这就像人的认知。一个成熟的人不是从每个细节重新推理世界,而是拥有稳定的抽象结构:物体会延续存在,行动会带来后果,目标会约束选择。内部世界越稳定,想象越不容易崩坏。

问题五:什么样的内部世界,才适合拿来训练智能?

很多人会以为,最好的世界模型就是最逼真的世界模型:像视频生成一样,把像素、纹理、细节全部还原。

但这篇论文暗示的方向更深:

好的世界模型,是适合行动的世界模型,不一定是最逼真的模型,而是最具有可推演性的模型。

比如逼真的街景,比如极简的可推演地图;逼真的分子动力学模型,不如可推演的牛顿力学;逼真的视频生成模型,不如稀疏因果世界模型。

论文讨论了 latent representation,也就是让动力学、奖励和策略运行在高层潜在空间中,而不是直接运行在原始观测上。它进一步连接到 temporal straightening(时间拉直):如果潜在空间中的连续状态变化方向更一致,长程预测就更像沿着一条较直的轨迹前进,误差也更容易控制。

认知的本质,就是将复杂、弯曲、高维的物理世界,投影到一个简单、平直、低维的内在几何空间中。在这个空间中,预测变得容易,规划变得简单,推理变得可行。

这就把问题从“世界模型是否逼真”推进到:

世界模型是否拥有适合行动的几何结构?

人类认知也是如此。我们不会在脑中渲染完整的物理世界,而是保留对行动有用的结构:距离、因果、障碍、目标、风险、代价。真正重要的不是复刻世界,而是压缩出一个可以推演、可以规划、可以选择的内部空间。

所以:智能的内在世界,不是现实的复制品,而是现实的可行动压缩。

问题六:如果真实数据很贵,应该买哪种数据?

到这里,论文进入一个非常现实的问题:

既然内部世界需要校准,而校准需要数据,那么有限预算应该怎么花?

是买更多 dynamics-transition samples,也就是“状态—动作—下一状态”的样本?

还是买更多 reward samples,也就是“状态—动作—奖励”的样本?

文章证明了一个结论:想象训练与真实训练性能存在严格误差上界,由动力学误差、奖励误差共同决定,加权和低于阈值即可保障现实适配性。

在合理阈值下,想象是高效认知推演;冲破临界阈值,会滋生恶性幻觉。

论文把这两类数据明确区分,并在 power-law scaling 假设下推导了最优的 dynamics-to-reward sample ratio。换句话说,它不是泛泛地说“数据越多越好”,而是需要在训练中回答:当不同数据的成本不同、学习速度不同,预算应该怎样分配,才能最小化想象训练带来的 return error?

这一步非常重要,因为它改变了我们对“数据”的理解。

数据不再只是堆料。数据变成了校准想象的不同工具。

有的数据帮助 AI 更好地预测世界。有的数据帮助 AI 更好地判断价值。

智能体真正需要的不是更多数据,而是“更有效地降低内部世界的关键误差”的数据。

问题七:便宜但有噪声的奖励,值不值得买?

这是论文里最有现实感的问题之一。

在很多场景中,高质量奖励很贵。比如 RLHF 里的人工偏好标注,机器人任务里的专家评估,自动驾驶中的安全判断。你可以花很多钱买少量高质量标注,也可以花较少的钱买大量有噪声标注。

那到底哪种更好?

论文分析了 REINFORCE 在 noisy rewards 下的情况。结论是:如果奖励噪声是零均值的,那么梯度估计仍然是无偏的,只是方差会增加;而这种额外方差可以随着 rollout 数量增加而下降。论文进一步把“买更高保真度奖励”还是“买更多低保真度奖励”的选择,化成一个一维优化问题。

这背后的思想很真实:

随机噪声不可怕,只要它不系统性地骗你。

一个标注者偶尔判断错,可能可以靠更多样本平均掉。

如果整个奖励机制都有偏见,更多样本只会让你更稳定地朝错误方向。

问题八:为什么系统性奖励偏差比噪声更危险?

论文最后特别区分了 zero-mean noise 和 systematic bias。它指出,更多轨迹可以降低方差,但不能消除系统性 reward bias。也就是说,如果奖励模型本身带着方向性的偏差,那么平均再多次,也不会让偏差消失。

这是整篇文章最值得上升到 AI 世界观的一点:

噪声是“不清楚”;偏差是“方向错了”。不清楚可以通过更多观察改善。

方向错了,则会被优化过程不断放大。

这也是为什么 reward model 在“想象训练”中如此关键。一个 AI 在内部世界里训练得越久,越可能把奖励模型中的偏差放大成策略偏差。它不是简单地犯错,而是在自己的想象中反复强化一个错误目标。

更有层次的总括

这篇论文真正提出的,不是“AI 可以不要数据”,而是一个更精确、更深刻的判断:数据的角色正在改变。

在旧范式中,数据是智能的主要来源。AI 看见大量过去,从中拟合规律。

在 training in imagination 的范式中,数据更像是锚点。

AI 用少量真实经验校准内部世界,然后在这个内部世界中大规模推演、试错和优化。

所以问题不再只是:AI 见过多少?而是:AI 能否用见过的东西,构建一个足够稳定、足够准确、足够可评价的内在世界?

智能,不只是从外部世界中提取模式,而是构建一个可推演的内在世界,并在其中预演可能未来的能力。

学习,不只是积累经验,而是不断校准这个内在世界:让它更准确地预测变化,更稳定地承载长程推演,更可靠地判断哪些未来值得追求。

数据,也不再只是被动堆积的训练材料,而是校准想象的真实锚点:一部分数据修正世界会如何变化,另一部分数据修正什么结果值得追求。

《On Training in Imagination》真正揭示的,是 AI 范式的一次重心迁移:

从“外部数据的规模”转向“内部模型的质量”;

从“被动感知世界”转向“主动生成未来”;

从“复刻已经发生的过去”转向“在想象中搜索尚未发生的可能性”。

真正强大的 AI,不是拥有最多记忆的系统,而是拥有最可靠想象力的系统。而可靠的想象力,来自三个条件:世界模型足够准确,内部表征足够稳定,奖励判断足够可信。

更凝练、更有传播感的一版:

智能的核心不是记住世界,而是内部重建世界;不是等待经验发生,而是在想象中预演经验;不是复刻过去,而是在可控的内部宇宙中搜索未来。

AI 的关键能力正在从“数据规模”转向“想象质量”。而想象质量,取决于它是否知道世界会怎样变化、哪些未来值得追求,以及这些内部推演能否在时间中保持稳定。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
49年开国大典,江青因没有证件被禁止进入,怒吼道:我是主席夫人

49年开国大典,江青因没有证件被禁止进入,怒吼道:我是主席夫人

大运河时空
2026-08-19 14:25:03
美国慌了!华盛顿终于发现:没有中国点头,美军根本打不了仗

美国慌了!华盛顿终于发现:没有中国点头,美军根本打不了仗

史怌的生活科普
2026-08-20 04:32:51
皇马主场迎战皇家社会,将在伯纳乌举办庆祝仪式,向库库雷利亚和对手10号致敬,庆祝世界杯夺冠

皇马主场迎战皇家社会,将在伯纳乌举办庆祝仪式,向库库雷利亚和对手10号致敬,庆祝世界杯夺冠

福酱的小时光
2026-08-25 22:16:59
又一部“牛来”,定档

又一部“牛来”,定档

中国新闻周刊
2026-08-25 13:25:59
太炸裂啊!三个孩子生父成谜,韦先生的老婆庭审上发声,她坚持不认错,坚称她婚内无过错

太炸裂啊!三个孩子生父成谜,韦先生的老婆庭审上发声,她坚持不认错,坚称她婚内无过错

火山詩话
2026-08-18 14:55:32
为10万美元搭上一辈子:朝鲜王牌飞行员驾机投奔美国,母亲与好友均遭处决,他活到了90岁,灵魂却早已输得精光

为10万美元搭上一辈子:朝鲜王牌飞行员驾机投奔美国,母亲与好友均遭处决,他活到了90岁,灵魂却早已输得精光

人生录
2026-08-23 00:05:16
早婚致数百万女孩辍学 教育损失为何总由女性承担

早婚致数百万女孩辍学 教育损失为何总由女性承担

心事寄山海
2026-08-25 00:57:52
央媒对樊振东的称呼变了,一字之差分量十足,刘国梁说对了

央媒对樊振东的称呼变了,一字之差分量十足,刘国梁说对了

锐评利物浦
2026-08-25 18:02:17
为啥是系列最高分?

为啥是系列最高分?

蛋蛋秀
2026-08-04 09:07:04
青年失业率是一个重要的指标

青年失业率是一个重要的指标

生命可以承受之轻
2026-08-24 09:06:46
续约谈判卡死!先签后换重磅交易曝光,杜伦有望4年1.8亿加盟凯尔特人

续约谈判卡死!先签后换重磅交易曝光,杜伦有望4年1.8亿加盟凯尔特人

夜白侃球
2026-08-25 11:48:50
始终不要忘记,我们是刚摆脱饥饿的一代人

始终不要忘记,我们是刚摆脱饥饿的一代人

黑噪音
2026-08-10 22:09:14
十四届全国人大常委会第二十四次会议在京举行

十四届全国人大常委会第二十四次会议在京举行

澎湃新闻
2026-08-25 17:16:13
老了才明白,钱一定要在这两个时间段给子女,千万不要给错了

老了才明白,钱一定要在这两个时间段给子女,千万不要给错了

风起见你
2026-08-23 08:37:16
肺结节开始癌变,身体会出现这7种症状,若发现一个,马上就医!

肺结节开始癌变,身体会出现这7种症状,若发现一个,马上就医!

纸上的心语
2026-08-16 10:59:40
巴枯宁向马克思提出尖锐问题:无产者掌权后能否守住阶级本心,马克思写下批注,回应出乎众人预料

巴枯宁向马克思提出尖锐问题:无产者掌权后能否守住阶级本心,马克思写下批注,回应出乎众人预料

磊子讲史
2026-07-09 13:51:15
穆里尼奥如何摆贝林修斯姆巴佩?

穆里尼奥如何摆贝林修斯姆巴佩?

张佳玮写字的地方
2026-08-25 17:12:21
苹果突然发布两款新 Mac !售价太狠了

苹果突然发布两款新 Mac !售价太狠了

花果科技
2026-08-25 22:22:22
万万没想到!路边18元一只的烤鸭,用的居然是这种鸭子,能吃吗?

万万没想到!路边18元一只的烤鸭,用的居然是这种鸭子,能吃吗?

琴音缭绕回
2026-08-24 12:10:55
欢子公司质问《披荆斩棘》节目为啥不给镜头?网友:还没浪姐的陈瑶和者来女体面

欢子公司质问《披荆斩棘》节目为啥不给镜头?网友:还没浪姐的陈瑶和者来女体面

师维
2026-08-25 23:22:13
2026-08-26 03:07:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4544203文章数 9354关注度
往期回顾 全部

科技要闻

机器人跑赢博尔特,身体太快,脑子还在追

头条要闻

赴韩遇害中国女生年仅25岁 原计划2天前入职新单位

头条要闻

赴韩遇害中国女生年仅25岁 原计划2天前入职新单位

体育要闻

穆里尼奥如何摆贝林修斯姆巴佩?

娱乐要闻

张韶涵成都演唱会中暑,中途吸氧

财经要闻

宇树科技最低跌破600元 5天缩水超2000亿

汽车要闻

硬派越野+华为智驾 泰钽700上市焕新价24.98万起

态度原创

亲子
时尚
家居
旅游
本地

亲子要闻

你天天吃零食,你孩子能不吃吗?家长要做榜样!言传身教!

出道8年成顶流,却在最红最美时退圈,为什么她至今仍是无数人的白月光?

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

避开网红景区看云南,山村巨石藏古老传说,至今没有确切答案!

本地新闻

无印良品竟是桐乡造?这座小城藏着一个刀具帝国

无障碍浏览 进入关怀版