网易首页 > 网易号 > 正文 申请入驻

上海AI Lab、浙大、NUS团队:世界模型,何去何从?

0
分享至


人工智能(AI)行业一直在讨论的世界模型(world model),下一步会走向何处?

在主流范式中,世界模型通常根据当前状态和动作预测下一状态。从 Sora 引发“世界模拟器”讨论,再到 Genie 3 实时生成可交互世界,讨论的核心仍然是如何把未来预测得更准、更逼真。

如今,上海 AI Lab 、浙江大学和新加坡国立大学(NUS)团队,提出了一个以 Agent 为中心世界模型范式:世界建模的未来,是从预测世界转向服务 Agent。

他们提出了以 Agent 为中心的交互式世界代理(World Proxy),在 Agent 与真实环境之间提供低成本、可控反馈,支持 Agent 的规划、学习和持续自我改进。


论文链接:https://arxiv.org/abs/2608.02713

项目页面:https://worldbench.github.io/awesome-agentic-world-model

具体而言,世界代理位于 Agent 与真实环境之间,根据 Agent 发起的查询、动作或干预,返回执行结果、经验/技能、奖励或验证信号,并在推理、训练和共同演化三个层级支持 Agent 自我改进。


图|以 Agent 为中心的世界代理的概念转向与设计空间。

研究团队表示,这项工作旨在建立以 Agent 为中心的新范式,为 Agent 更好规划、更快学习提供路线图。

世界模型,要以 Agent 为中心

持续改进的 Agent 需要超越静态监督,通过动态交互获得反馈。而真实环境交互成本高、错误操作难以回滚、反馈滞后,也难以大规模并行化。传统世界模型通常以未来物理状态预测为核心,但对需要可操作反馈的 Agent 而言,其建模范围仍然有限。

在这项工作中,世界代理位于 Agent 与真实环境之间,在 Agent 提交真实动作前预测、检索或验证相关反馈,让 Agent 能够以更低成本获得可用于决策和改进的信息。

具体而言,一个以 Agent 为中心的世界代理,需要满足三个要求:

1.支持 Agent 主动发起查询、动作或干预,并形成闭环;

2.基于真实环境的数据、规则、轨迹或交互证据学习,保持环境锚定;

3.以可操作的信息增益为目标,为规划、决策、探索和训练提供有效反馈,而不仅追求视觉真实感或状态预测准确率。

具体流程如下:

1.发起交互: Agent 根据当前目标与上下文,主动提出查询、动作或干预。

2.预测信息转移: 世界代理在当前信息状态与交互条件下,预测或生成反馈。

3.返回反馈: 反馈作为信息增益回到 Agent ,例如未来状态、预测观察、执行结果、检索到的指导或验证结论。

4.用于改进: Agent 将反馈用于规划、决策、策略学习或持续改进。


图|从世界模型到世界代理。

单次运行时,世界代理只返回一次预测、检索或验证反馈。在多步迭代中,它的反馈会持续影响 Agent 后续的查询、动作与策略更新,并形成改进轨迹。一个好的世界代理,需要提供环境锚定、可控、有用、可扩展且具有前瞻性的反馈

世界代理,如何改进 Agent

世界代理对 Agent 的赋能,可以按介入改进流程的深度分为三个层级。它既可以在推理时补充上下文,也可以在训练时生成优化信号,还可以与 Agent 一起随真实环境反馈持续更新。具体机制如下:


图|用于 Agent 改进的 L1 至 L3 世界代理。

L1 推理时引导(Inference-Time Guidance):最轻的一层介入。世界代理不改动 Agent 参数,只在推理阶段提供记忆/技能检索、执行模拟或验证反馈,并将其并入当前上下文。流程上,Agent 发起查询,世界代理返回引导结果,Agent 再据此决策。这一层成本低、可回滚,但上限受限于 Agent 已有能力。它的好处是让 Agent 在当前回合内看得更多、推理更准、动作更稳。


图|L1 通过世界代理进行推理时引导。

L2 训练时优化(Training-Time Optimization):这一层中,世界代理的作用从当前决策延伸到策略训练。它会处理 Agent 的 rollout,如为轨迹打分、指出失败原因、生成合成轨迹或偏好对,也可以根据失败模式生成新的训练任务。这些信号随后被用于 SFT、DPO、PPO 或 GRPO 等训练,让 Agent 自己的交互过程成为优化策略的燃料。


图|L2 由世界代理驱动的训练时优化。

L3 Agent-代理共同演化(Agent-Proxy Co-Evolution):这是介入最深的一层。真实轨迹、失败案例和新发现会持续回流到世界代理中,使其随环境和任务更新;更新后的世界代理再反过来引导、验证和训练 Agent。这样,Agent 与世界代理在闭环中持续互相更新,共同提升。


图|L3 Agent 与世界代理共同演化。

除了 L1-L3 的介入层级,世界代理还可以按所建模的信息转移类型划分为六种功能形态。不同形态返回不同反馈,在实际应用中也常被组合使用。


图|以 Agent 为中心的世界代理的功能形态。

动力学形态:关注动作后的环境变化,最接近经典世界模型。它接收当前状态、历史观察和 Agent 动作,预测未来状态,必要时也可预测奖励。

空间形态:关注从另一个视角会观察到什么。Agent 查询新的位置、相机位姿或视角,世界代理返回相应的观察或空间表征,让 Agent 在移动前先看一眼。

执行形态:关注数字环境会返回什么。它模拟代码、命令、网页点击、API 或工具调用后的状态变化,以及 stdout、stderr、错误信息、测试结果或页面变化。

记忆/经验形态:关注当前决策所需的历史经验、失败案例或约束。它从过往交互、轨迹和失败中检索相关信息,并将这些经验反馈给规划过程。

技能形态:关注当前任务可以使用什么技能。它根据目标、上下文和环境状态,推荐可复用技能、工具使用流程或动作先验。

奖励/验证形态:关注行为是否正确、安全、可行,以及应当如何改进。它评估 Agent 的行为、轨迹、答案或计划,输出奖励、批评、偏好或验证结论。

不足和未来方向

不过,尽管世界代理能够降低真实环境中的交互成本,但目前仍存在以下不足:

首先,它反馈的逼真度和长期可靠性有限。生成结果可能看似合理,却违反实际动力学规律,错误还会在长轨迹中不断累积。未来需要关注长轨迹预测、误差传播和不确定性校准,而不仅是生成更逼真的结果。

其次,Agent 仍难以判断何时应该信任代理,何时需要返回真实环境验证。过度依赖世界代理,可能导致难以及时发现的错误。未来需要加强置信度评估、风险感知和真实环境回退机制。

此外,当世界代理被用作奖励模型或验证器时,Agent 可能利用其判断盲点,产生奖励 hacking 和安全风险。后续研究需要提升世界代理的鲁棒性,并引入对抗测试、独立验证和权限控制。

最后,信息增益仍缺乏统一的评估标准。现有基准更多关注真实感、可控性、预测准确率或人类偏好,却往往将世界代理与 Agent 分开评估。未来,仍需建立以 Agent 为中心的评测体系,衡量世界代理反馈是否真正帮助 Agent 规划、学习和持续改进。

作者:夏千斯

如需转载或投稿,请直接在本文章评论区内留言

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
质疑!1.4亿买19岁天才还是27岁老将?皇马队史标王引爆年龄大瓜

质疑!1.4亿买19岁天才还是27岁老将?皇马队史标王引爆年龄大瓜

体坛老球迷
2026-08-12 10:16:37
男童被巨浪卷走后续,官媒怒批家属,当地不敢救,救了也必死无疑

男童被巨浪卷走后续,官媒怒批家属,当地不敢救,救了也必死无疑

社会日日鲜
2026-08-11 09:21:27
第二批朝鲜兵抵达俄罗斯!兵力5万+新武器,泽连斯基最担心的事情还是发生了

第二批朝鲜兵抵达俄罗斯!兵力5万+新武器,泽连斯基最担心的事情还是发生了

军武次位面
2026-08-10 17:55:01
卫诗雅回应领奖后孤独下台:现场很多人不认识,只认识朱一龙和梁家辉,心情很开心没有孤独感

卫诗雅回应领奖后孤独下台:现场很多人不认识,只认识朱一龙和梁家辉,心情很开心没有孤独感

韩小娱
2026-08-12 12:04:44
一超市老板租借手机号7000余个,从购物平台“薅掉”10余吨大米、鸡蛋,通过自己的超市售卖,已被警方抓获

一超市老板租借手机号7000余个,从购物平台“薅掉”10余吨大米、鸡蛋,通过自己的超市售卖,已被警方抓获

极目新闻
2026-08-12 12:12:54
泪奔!程梦圆遗体腐臭,哥亲手抬棺送老家,哭着说:妹怕黑 咱回家

泪奔!程梦圆遗体腐臭,哥亲手抬棺送老家,哭着说:妹怕黑 咱回家

吃货的分享
2026-08-11 08:54:16
中印谈完不到24小时,印度给中国领土改名,连射两款导弹耀武扬威

中印谈完不到24小时,印度给中国领土改名,连射两款导弹耀武扬威

共工之锚
2026-08-12 00:27:19
脸都不要了?王宝强百花奖0票,这是200亿影帝的“羞辱”之夜

脸都不要了?王宝强百花奖0票,这是200亿影帝的“羞辱”之夜

文刀贰
2026-08-10 22:59:15
被烧了164年的圆明园,地下忽然传出动静,专家:我们被骗惨了

被烧了164年的圆明园,地下忽然传出动静,专家:我们被骗惨了

道远文史
2026-08-12 06:59:17
不查不知道!原来卫诗雅身上这条亮眼的蓝裙子,只是一件27000的成衣,英皇根本没有给她借到高定礼服

不查不知道!原来卫诗雅身上这条亮眼的蓝裙子,只是一件27000的成衣,英皇根本没有给她借到高定礼服

火山詩话
2026-08-12 08:15:28
“结婚八年三女儿均非亲生”离婚案将于8月17日开庭

“结婚八年三女儿均非亲生”离婚案将于8月17日开庭

澎湃新闻
2026-08-12 11:03:10
宁波环城南路高架下起“火瀑布”?交警回应:系面包车自燃,无人员受伤

宁波环城南路高架下起“火瀑布”?交警回应:系面包车自燃,无人员受伤

齐鲁壹点
2026-08-12 12:15:02
货拉拉司机加价不成带着货跑到600多公里外,平台介入交涉仍拒交货

货拉拉司机加价不成带着货跑到600多公里外,平台介入交涉仍拒交货

新闻晨报随申Hi
2026-08-11 18:52:19
好评中国 | “人工智能+”澎湃经济新浪潮

好评中国 | “人工智能+”澎湃经济新浪潮

闪电新闻
2026-08-12 08:48:19
诺奖委,是时候给黄院士颁奖了!本人首次回应来了!

诺奖委,是时候给黄院士颁奖了!本人首次回应来了!

闲侃闲侃
2026-08-12 08:08:33
今日北京铁路计划停运123趟列车,民航计划取消航班57架

今日北京铁路计划停运123趟列车,民航计划取消航班57架

新京报
2026-08-12 10:39:29
离婚半年后,我还是想他,鼓起勇气给他发了条消息:干嘛呢?他秒回:你只要再多问一个字,我明天就坐最早的飞机回来追你

离婚半年后,我还是想他,鼓起勇气给他发了条消息:干嘛呢?他秒回:你只要再多问一个字,我明天就坐最早的飞机回来追你

晓艾故事汇
2026-08-12 10:14:47
如临大敌!网传坊间相互提醒重庆王先生一伙人到西藏旅游,评论区炸锅

如临大敌!网传坊间相互提醒重庆王先生一伙人到西藏旅游,评论区炸锅

火山詩话
2026-08-12 07:31:02
世界杯夺冠英雄 5000万送走!巴萨离队第7人敲定 只差官宣

世界杯夺冠英雄 5000万送走!巴萨离队第7人敲定 只差官宣

叶青足球世界
2026-08-12 09:00:44
“卫诗雅百花奖获最佳女主后孤独下台”引热议,本人回应:现场认识的人不多,也就梁家辉和朱一龙,并不是孤单;原本担心获零票会很尴尬

“卫诗雅百花奖获最佳女主后孤独下台”引热议,本人回应:现场认识的人不多,也就梁家辉和朱一龙,并不是孤单;原本担心获零票会很尴尬

鲁中晨报
2026-08-12 11:06:52
2026-08-12 13:40:49
学术头条
学术头条
致力于学术传播和科学普及,重点关注AI4Science、大模型等前沿科学进展。
1467文章数 5081关注度
往期回顾 全部

科技要闻

Claude又出骚操作 改个错字也要留AI水印?

头条要闻

行长套取2100万获刑:3100万的万柳书院月供9万压力大

头条要闻

行长套取2100万获刑:3100万的万柳书院月供9万压力大

体育要闻

乔丹鲨鱼们的合同:1996,史上最伟大夏天

娱乐要闻

陈思诚恋情疑云再起

财经要闻

李嘉诚,再一次大撤退!他嗅到了什么?

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

旅游
健康
教育
时尚
公开课

旅游要闻

烟火巷陌间隐藏着无数创业温床,尽显这座旅游网红城市的包容底色

心血管专家破解猝死八大谣言

教育要闻

2026上海长宁高中补习机构推荐|上海长宁家长辅导班实测优选(2026优选版)

百花奖,不渡85花

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版