网易首页 > 网易号 > 正文 申请入驻

EMNLP 2026 Main|预测越像真实环境

0
分享至

来源:市场资讯

(来源:机器之心)


  • 论文标题:Beyond State Consistency: Behavior Consistency in Text-Based World Models

  • 录用信息: EMNLP 2026 Main Conference

  • 论文链接:https://arxiv.org/abs/2604.13824

  • 代码开源:https://github.com/Ricardo-H/behr-wm

  • 模型开源:https://huggingface.co/collections/Ricardo-H/behr-behavior-consistent-world-models

一句话概括:文本世界模型都在比 "生成文本像不像真实环境",但我们发现文本更接近真实环境的预测反而可能让智能体错得更离谱。把训练目标从 "状态一致" 换成 "行为一致" 后,16 组实验配置下世界模型的轨迹级一致性几乎全面提升,弱智能体离线评测的假阳性率从 42.5% 降到 9.5%。

预测偏差不可避免时,什么才是 "关键" 幻觉?

LLM agent 在网页导航、工具调用、文本冒险等任务上进步很快,但让智能体在真实环境里跑一遍代价不小:慢、贵,有时还会触发不可逆操作。一种思路是用另一个 LLM 来 "扮演" 环境 —— 智能体在电商网站点击 "搜索毛衣",这个模型就生成搜索结果页;智能体选了某件商品,它就给出商品详情页。这就是文本世界模型。有了它,智能体可以在模拟环境中做离线评估或前瞻规划,不用真的去访问网站。

怎样才算一个好的世界模型?现有方法几乎都给出同一个答案:让生成文本尽可能贴近真实环境。训练上,无论是监督学习(在真实轨迹上做逐 token 最大似然)还是强化学习(以 F1 score 等文本相似度作为 reward),优化目标都指向同一件事 —— 让预测文本更接近真实观察;评估上也用 F1、BERTScore、ROUGE-L 等指标衡量文本相似度。背后的逻辑很直接:文本越接近真实,世界模型就越好;所有偏离真实的生成幻觉都是需要相同压制的误差。

如果真能把所有幻觉都消掉,这套逻辑当然成立。但在长步交互中,几十步自回归预测下误差不断累积,漏商品、错属性、编造 UI 元素难以避免。既然幻觉短期内无法完全消除,一个更实际的问题是:不同类型的幻觉对下游智能体决策的影响是否相同?训练目标能否引导模型把错往 "无害" 方向犯,而非往 "致命" 方向犯?

文本越像,智能体未必做得更好


图 1:指标反转示意图。世界模型的两种幻觉输出 —— 输出 1 遗漏了目标毛衣,BERTScore 仍高达 0.974,但智能体找不到目标、任务失败;输出 2 仅遗漏了两个无关商品(连衣裙和围巾),BERTScore 降到 0.859,智能体反而顺利完成了购买。BehR 正确识别了 "关键" 幻觉。

图中两种输出都是 "遗漏商品" 的幻觉,但对智能体决策的影响截然不同:输出 1 少了目标商品,智能体根本找不到要买的东西;输出 2 少了两件无关商品,丝毫不影响购买。然而主流文本保真度指标对这两类错误的反馈恰好反了 —— 更严厉地惩罚删掉无关商品的 "良性幻觉",反而放过删掉目标商品的 "致命幻觉"。在模型必然会犯错的前提下,现有训练目标不仅没让世界模型把错往 "无害" 方向犯,反而在主动把它往 "致命" 方向推。

我们用受控扰动实验定量验证了这种 "指标反转" 现象:F1 score、BERTScore、ROUGE-L 甚至 GPT-4o 当裁判,全部排反。只有 BehR 同时实现正确排序和稠密信号。

这说明文本保真度不等于功能正确性,主流世界模型的训练目标一直没有对齐智能体真正在意的东西。

从 "状态一致" 到 "行为一致"

既然文本相似度不可靠,我们换一个角度:如果智能体在预测状态和真实状态下做出一样的决策,这个预测就是好的。我们把这个目标定义为 "功能一致性"(Functional Consistency),形式上:

其中 是真实状态, 是预测状态, 是历史轨迹。类比翻译:逐字直译未必是好翻译,关键是读者能不能从译文中做出和原文一样的判断。

方法:行为一致性奖励 BehR


图 2:BehR 训练流程。上方为传统做法(对应监督学习的 MLE 和以 F1 为 reward 的强化学习):比较预测与真实状态的文本相似度。下方为 BehR:冻结的参考智能体在两种状态下分别对同一动作打分,打分之差即为奖励信号。

BehR(Behavior Consistency Reward)的思路很朴素:找一个冻结的参考智能体,让它分别在真实状态和预测状态下输出同一动作的对数概率,两者越接近,奖励越高:

具体而言:两种状态下打分一致则奖励最大;删掉目标商品会导致打分骤变、奖励暴跌;删掉无关商品几乎不影响打分、奖励不变。训练采用 GRPO(Group Relative Policy Optimization):世界模型对每个样本生成若干候选预测,各自计算 BehR,做组内相对归一化得到策略梯度。

实验结果

我们在 WebShop(电商导航)和 TextWorld(文本冒险)上验证,基座覆盖 Qwen2.5-7B 与 LLaMA3.1-8B,评测智能体包含 Qwen3-8B、Qwen3-32B、GPT-4o、GPT-5 共 4 个。评测时让同一智能体分别在真实环境和世界模型中跑完整轨迹,对比两者的任务结果是否一致(,越接近 1.0 越好)。


表 1:多智能体评估全表。Real = 智能体在真实环境中成功率;WM = 智能体在世界模型中成功率;W2R = 把世界模型中的动作序列放回真实环境复放的成功率;CR 为 W2R 与 Real 成功率之比;$$CR_{pw}$$ 为逐任务配对一致率,也是论文的主指标。

在 16 组配置中,BehR 世界模型相比基线在 13 组上提升了 ,其余 3 组持平,没有出现退化。WebShop 上提升最显著:

  • Qwen3-8B: 从 0.345 提升至 0.483(+13.8 个百分点,约 +40%);

  • GPT-4o: 从 0.760 提升至 0.840(+8.0 个百分点,约 +10.5%)。

TextWorld 上强智能体基线已接近分数上限,BehR 的作用更多是维持这种近乎满分的一致性。

两个下游应用

离线评估。 世界模型生成的环境比真实环境更简单时,弱智能体也能蒙混过关。TextWorld 上 Qwen3-0.6B 的真实成功率为 0%,基线世界模型却把 42.5% 的任务判为成功 —— 近一半任务是假阳性。BehR 训练后假阳性率降至 9.5%,一致率从 57.5% 升到 90.5%。

前瞻规划。 让智能体每步提出 5 个候选动作,用世界模型模拟后挑最优。BehR 世界模型帮 Qwen3-8B 在 WebShop 上把成功率从 14.5% 提升到 25.5%(+11.0pp),高于基线的 +9.0pp。越弱的智能体获益越大 —— 它越需要 "先想一下再行动"。

总结

我们揭示了文本世界模型评估中的指标反转现象,并把训练目标从 "状态一致" 转向 "行为一致",提出行为一致性奖励 BehR:用冻结参考智能体的决策差异代替文本相似度作为训练信号。整个流程只需要本地冻结的参考智能体提供反馈,不需要额外的人工偏好标注。消融实验也证实了提升确实来自奖励函数本身,而非其他训练细节。在两个环境、两种基座、四种评测智能体的 16 组配置中,BehR 在绝大多数组合上都提升了轨迹级一致性;在离线评测和前瞻规划上也有明确收益。

我们希望这项工作能让社区重新审视一个问题:世界模型的价值不在于生成的预测有多像真实环境,而在于能否让智能体做出一致的决策行为。

作者简介

本文由大连理工大学、MBZUAI、北京大学及微软合作完成。团队成员包括 Youling Huang, Guanqiao Chen, Junchi Yao, Lu Wang, Fangkai Yang, Chao Du, Chenzhuo Zhao, Pu Zhao, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
快速拉升!日股,上涨近1000点

快速拉升!日股,上涨近1000点

证券时报
2026-09-30 09:17:02
10月最该吃的不是冬瓜萝卜,而是这8样“黄金菜”,吃过都说好

10月最该吃的不是冬瓜萝卜,而是这8样“黄金菜”,吃过都说好

美食店主
2026-09-29 00:14:58
原来他是刘欢岳父!湖南著名口腔专家,爱帮刘欢看牙,喜欢北京人

原来他是刘欢岳父!湖南著名口腔专家,爱帮刘欢看牙,喜欢北京人

兵鉴史
2026-09-30 14:05:31
英超 CEO 就曼城长达十年的系统性违规公开发声

英超 CEO 就曼城长达十年的系统性违规公开发声

夜白侃球
2026-09-30 10:45:18
突然发现:只有一个女儿的家庭,女婿再好,也别交出以下4样东西

突然发现:只有一个女儿的家庭,女婿再好,也别交出以下4样东西

风起见你
2026-09-19 00:56:35
普京再签扩军令俄军增至244万人,今年以来已第4次扩军

普京再签扩军令俄军增至244万人,今年以来已第4次扩军

澎湃新闻
2026-09-29 01:54:46
8亿铂金级肉签公布中签结果,中签号码9.07万个,股民中了即赚了!

8亿铂金级肉签公布中签结果,中签号码9.07万个,股民中了即赚了!

数据挖掘分析
2026-09-30 08:15:47
姚明回苏州喝喜酒被拍!2米26坐大厅不抢镜,接烟细节显高情商

姚明回苏州喝喜酒被拍!2米26坐大厅不抢镜,接烟细节显高情商

做一个合格的吃瓜群众
2026-09-29 20:07:39
零钱通、余额宝9月30日起将无法直接用于支付?官方回复

零钱通、余额宝9月30日起将无法直接用于支付?官方回复

齐鲁壹点
2026-09-30 12:04:11
今年小富即安,明年大富大贵!一路走来都是高光幸福人生的 3生肖

今年小富即安,明年大富大贵!一路走来都是高光幸福人生的 3生肖

毅谈生肖
2026-09-30 11:10:15
与主帅爆发冲突,皇马中场被踢出名单

与主帅爆发冲突,皇马中场被踢出名单

星河漫山野
2026-09-29 15:51:17
16GB+1TB!新机官宣:10月12日,正式发布!

16GB+1TB!新机官宣:10月12日,正式发布!

科技堡垒
2026-09-29 10:18:18
《我的前半生》人到中年才懂贺涵放弃唐晶爱上罗子君,是人性必然

《我的前半生》人到中年才懂贺涵放弃唐晶爱上罗子君,是人性必然

亦暖追剧随笔
2026-09-29 13:23:40
那英成都演唱会临时加唱《弯弯的月亮》,文旅局回应:还在了解和调查核实中

那英成都演唱会临时加唱《弯弯的月亮》,文旅局回应:还在了解和调查核实中

韩小娱
2026-09-29 09:23:39
突发!反悔了!4年2.29亿?去TM的替补...

突发!反悔了!4年2.29亿?去TM的替补...

左右为篮
2026-09-30 12:41:39
血液科医生:血糖不超过这个值,不用太克制自己,吃点甜有好处

血液科医生:血糖不超过这个值,不用太克制自己,吃点甜有好处

路医生健康科普
2026-09-30 13:03:18
霍尔木兹海峡石油出口恢复,伊朗王牌被“废”难怪特朗普不着急

霍尔木兹海峡石油出口恢复,伊朗王牌被“废”难怪特朗普不着急

悠悠写故事
2026-09-30 10:13:13
老胡为何总在师德问题上玩双标逻辑

老胡为何总在师德问题上玩双标逻辑

小眼睛小世界
2026-09-30 04:17:53
广东一市官宣:不用中考分流,小初高一路读上去,2027年秋试点

广东一市官宣:不用中考分流,小初高一路读上去,2027年秋试点

财联社
2026-09-29 20:31:02
中日会谈交锋激烈,中方当面告诫日方:若敢翻案,中日无未来前言

中日会谈交锋激烈,中方当面告诫日方:若敢翻案,中日无未来前言

始于初见见
2026-09-30 13:13:41
2026-09-30 15:04:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4938875文章数 9699关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

特朗普贸易顾问讲到中国上头了:加拿大说客滚出美国

头条要闻

特朗普贸易顾问讲到中国上头了:加拿大说客滚出美国

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

金鹰这夜,演员争辉,有惊喜,反差

财经要闻

中央财政首次贴息房贷 定向支持首套刚需

汽车要闻

多项黑科技加身/预计40万级 方程豹钛9将于四季度上市

态度原创

游戏
旅游
亲子
艺术
公开课

CDPR官方回应!《巫师3重制》存档丢失解决方法

旅游要闻

大理古城,你!是!懂!国!庆!的!

亲子要闻

孩子以后长多高, 可以用这个公式计算!

艺术要闻

90年代重庆豪宅群,烂了30多年,现在荒成什么样了?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版