斯坦福大学与北京大学联合发表的一篇新论文指出,在学到的世界模型内部训练机器人策略,会继承该模型的每一个错误。随着任务变长、图像变复杂,这些错误会不断累积,最终影响机器人的实际表现。
问题根源:错误在模型内部累积
![]()
研究团队认为,传统方法将策略训练置于世界模型内部,相当于让机器人“带着老师的错误答卷答题”。任务复杂度上升时,模型预测偏差会被逐步放大,导致策略偏离真实环境。
QWM方案:世界模型完全退出训练
论文提出的QWM(基于世界模型的Q学习)方法,核心改动在于:世界模型完全不参与训练过程。它只作为辅助工具,在机器人做选择时提供参考,而策略本身的优化路径不再经过模型内部。
这一设计切断了错误传递链条,让机器人策略直接面向真实交互数据学习,而非间接依赖模型预测。
论文已发布于arxiv(编号2608.17163),题为“Q-Learning With World Models”。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.