网易首页 > 网易号 > 正文 申请入驻

ASU 魏华:大模型智能体正在重蹈强化学习的覆辙,如何跨越「仿真到现实」的鸿沟? | IJCAI 2026

0
分享至


当大语言模型化身为智能体走向真实世界,它们面临的困境,与十年前在十字路口指挥交通的强化学习模型如出一辙。 作者丨岑峰幸丽娟

编辑丨岑峰

在通往 AGI 的浪潮中,基础模型智能体(Foundation Model Agents)正以前所未有的速度接管各种任务。业界曾普遍乐观地认为,凭借大模型海量的预训练知识,智能体可以无缝适应各种真实场景。

但在现实中,当我们将一个在英文语境下表现完美的智能体,切换到中文或低资源语言环境中时,其错误率往往会呈现断崖式上升。

这种环境切换带来的“智力降级”,真的是大模型时代特有的新问题吗?

在正在进行的 2026 年的德国不莱梅 IJCAI大会的 Early Career Spotlight(早期职业焦点)环节,亚利桑那州立大学(ASU)助理教授魏华给出了一个极具启发性的“降维”视角:今天大模型智能体所面临的脆弱性,本质上与传统强化学习(RL)在物理世界中遭遇的“仿真到现实(Sim-to-Real)”差距如出一辙。

作为长期深耕强化学习与真实世界决策的学者,魏华教授早年曾在腾讯 AI Lab 担任研究员,后于新泽西理工学院和 ASU 任教。早在2017 年,魏华团队就通过一系列 KDD论文证明了强化学习能够完美复现传统的“绿波”优化解,甚至能找到更优的调度策略。

但随着研究从实验室走向中国杭州等真实复杂路网,他发现,完美的模拟器是不存在的。天气、摄像头视角、甚至奖励函数的定义,在真实世界中都存在着致命的偏差。实验室中取得的完美结果一旦部署到真实的街头,面对大雨、大雾以及穿行的行人,AI 的决策就会瞬间崩溃。

在此次 IJCAI 的演讲中,魏华巧妙地将“交通信号灯”与“大语言模型”连接了起来。他指出,无论是机器人、强化学习还是今天的大模型智能体,只要涉及决策与执行,就必然面临动态差距、观察差距和奖励差距。

更为重要的是,他提出,既然问题的本质相同,我们完全可以将机器人领域成熟的“域随机化(Domain Randomization)”等技术,直接“平移”到大模型智能体中。最新的实验证明,通过对智能体的提示词、动作和奖励空间进行随机化扰动,一个仅 30 亿参数(3B)的模型,在应对跨语言等“仿真到现实”难题时,其表现甚至能击败 320 亿参数(32B)的庞然大物。

此外,魏华强调了“不确定性量化”与“人类在环(Human-in-the-loop)”的终极价值:智能体可以无限扩展,但不能增加人类的监督负担。机器必须知道自己“何时不知道”,并精准地向人类求助。

以下是魏华教授的演讲分享,演讲题目为《Towards Reliable Agents》。AI科技评论根据其英文演讲内容进行了不改原意的深度编辑与精简:


▎Towards Reliable Agents(迈向可靠智能体)

演讲者: 亚利桑那州立大学助理教授 魏华(Hua Wei)

大家好。我是亚利桑那州立大学计算与人工智能学院的助理教授魏华。非常荣幸能来到 IJCAI的讲台,分享我过去研究的一些反思,探讨我们曾尝试的不同视角,以及对未来工作的展望。


我们团队一直以来的一个核心命题是:我们能否为现实世界的复杂决策,构建真正可靠的智能体(Agents)?


01

完美的模拟器,与混乱的物理世界

为了说明这个问题,我们回到 2017 年,从我最初研究的“交通信号控制强化学习”说起。我们希望通过协调城市里的每一个交通信号灯,让所有车辆都能更顺畅地通行,并将其部署到物理世界中。

这一时期,我们做了一些关于多智能体系统和“仿真到现实(sim-to-real)”迁移的研究。以交通信号控制为例,在交通信号控制的强化学习中,智能体的“状态”是路口的排队车辆数,“动作”是切换红绿灯,“奖励”则是最小化所有车辆的通行时间。

在 2018 年和 2019 年的 KDD 论文中[1,2],我们证明了强化学习确实能学到与传统运筹优化相同的最优解,比如著名的“绿波”效应(让车辆一路绿灯畅行),而且它能更好地适应非匀速的真实车流。


然而,当我们试图把在模拟器里训练得炉火纯青的算法拿去现实中部署时(例如在中国杭州的真实复杂路网),问题出现了。在模拟器中,汽车的驾驶行为高度规律,但在现实世界,每个交通参与者都有自己的目的,路况瞬息万变,根本不存在一个能完美拟合真实物理世界的模拟器。

这就是我们所说的“仿真到现实(Sim-to-Real)”差距。基于这种惨痛的现实认知,我们开始深入研究 Sim-to-Real的迁移问题。我们的目标是让模型在模拟环境中的表现与在真实世界中的表现无限趋近,让差距(Gap)接近于零。


在研究中[3],我们将这种复杂的现实鸿沟系统性地拆解为了五个子维度:观察差距(Observation Gaps)、状态差距(State Gaps)、动作差距(Action Gaps)、动态差距(Dynamics Gaps)以及奖励差距(Reward Gaps)。

例如动态差距,在模拟器中,如果变绿灯,我们假设所有车都会顺利通过。但如果在真实的雨天、雾天或雪天,车辆行驶缓慢,同样的绿灯时长,可能只有两辆车通过,剩下一辆被堵在路口。这意味着:相同的状态和动作,在虚实两个世界中会导致完全不同的下一个状态。

随着时间的推移,这种偏差(Drift)会像滚雪球一样越来越大。在 AAAI 2024的工作[4]中,我们尝试将天气等背景信息作为条件输入来缩小这种差距,但仍无法做到完美。

还有观察差距,在训练中,摄像头视野清晰;但在雾天、雪天或黑夜,传感器捕捉到的画面会大打折扣[5]。模型如何能保证在完美视觉下训练的策略,在恶劣天气或夜间依然鲁棒?

以及奖励差距,在模拟器里,我们的唯一目标是最小化汽车的通行时间。但在真实世界中,你不能只看汽车,还要考虑行人的安全和通行效率。一旦引入真实约束,你原本设定的完美奖励函数就会发生剧变,目标函数的错位,会导致智能体做出危险决策。


02

大模型智能体,正在重蹈覆辙

刚才我们谈论的是传统强化学习,但我们惊讶地发现:如今备受追捧的基础模型智能体,正在面临完全相同的挑战,只是人们换了一套术语。

以大模型的多语言能力为例,如果用英语向大模型提问,它表现得完美无瑕;但如果切换到中文、德语甚至一些低资源语言,它的错误率就会出现断崖式上升。在自然语言处理(NLP)领域,大家管这叫多语言泛化难题。


但在上周的 KDD 大会上[6],我们提出:基础模型智能体中的可靠性问题,本质上就是一个标准的“仿真到现实”问题。

如果把每种语言看作一种“模态”,模型的训练数据主要是一种模态(英语语境,相当于“模拟器”),而它的测试环境是另一种模态(其他语言,相当于“复杂的真实世界”)。这就完美对应了我们刚才提到的“观察差距”。

既然问题的本质相通,我们完全可以从成熟的强化学习或机器人领域“借用”破局思路。


03

用“域随机化”为大模型降维解局

在机器人控制中,为了弥补模拟器与现实的差距,我们常用一种叫“域随机化(Domain Randomization)”的技术:在训练时人为地对输入的文本、标题、描述甚至动作和奖励空间进行随机化扰动。以提升模型在真实世界中的鲁棒性。

我们将这一理念直接引入到了大语言模型智能体中,在测试大模型时,我们对其输入的文本、提示词、参数描述甚至它所面临的动作与奖励空间,进行大规模的“随机化重写与扰动”[7,8]。结果令人极其振奋:一个仅仅 30 亿(3B)参数的小模型,在经过域随机化处理后,其应对跨环境差距的表现几乎接近完美,甚至击败了规模大十倍的 320 亿(32B)参数的最佳模型。

这说明,机器人领域历经检验的“抗干扰”哲学,在今天的大模型智能体时代依然是大杀器。动作、奖励、转换等维度的差距,是所有决策智能体共通的顽疾。


04

随机化与“不确定性量化”的安全底线

最后,我想谈谈我个人目前极其兴奋的研究方向:不确定性量化(Uncertainty Quantification)。在试图弥合虚实鸿沟的所有方案中,我们必须承认一个现实:我们可能永远无法做到完美的闭环。

面对充满未知的真实世界,如果我们想要保证智能体在真实世界中不出致命错误,最终极的防线始终是“人类在环(Human-in-the-loop)”。机器必须知道自己“什么时候不确定”,知道何时该自主决断,何时必须呼叫人类支援,在关键时刻将决策权交给人类。


▎为此,我们为大模型定义了四个层级的不确定性量化[9]:

1.答案本身是否值得信任?

2.模型的推理逻辑是否脆弱?

3.能否精确定位是哪一步推理犯了错?

4.该智能体的认知是否与其他模型/系统对齐?

总结而言,我们认为“仿真到现实”的差距广泛存在于机器人学、强化学习、真实世界以及基础模型智能体等大多数决策场景中。我们呼吁上述领域的学者建立一套共通的底层词汇与评估标准,我们就可以测试并且共享相同的技术。

在未来,智能体可以无限制地扩大规模、接管更多的任务,但人类的监督负担绝不能随之呈指数级加重。让机器学会在不确定时求助,把最关键的问题留给人类,才是 AI 走向真实世界的最优解。


以上是我的演讲。如果你们对这一话题感兴趣,欢迎在微信、LinkedIn以及我的播客上[10]进一步交流。

[1] Hua Wei, Guanjie Zheng, Huaxiu Yao and Zhenhui Li. IntelliLight: A ReinforcementLearning Approach for Intelligent Traffic Light Control. In Proceedings of the 24th ACMSIGKDD International Conference on Knowledge Discovery and Data Mining (KDD2018).

[2] Hua Wei, Chacha Chen, Guanjie Zheng, Kan Wu, Vikash V. Gayah, Kai Xu andZhenhui Li. PressLight: Learning Max Pressure Control to Coordinate Traffic Signals inArterial Network. In Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD 2019).

[3] Longchao Da, Justin Turnau, Thirulogasankar Pranav Kutralingam, AlvaroVelasquez, Paulo Shakarian, Hua Wei. A Survey of Sim-to-Real Methods in RL:Progress,ProspectsandChallengeswithFoundationModels.https://arxiv.org/abs/2502.13187

[4] Longchao Da, Minchiuan Gao, Hao Mei, Hua Wei. 2024. Prompt to transfer:Sim-to-real Transfer for Traffic Signal Control with Prompt Learning. In Proceedings of the Thirty-Eighth AAAl Conference on Artificial Intelligence (AAAl'24).

[5] Tiejin Chen, Prithvi Parag Shirke, Bharatesh Chakravarthi, Arpitsinh RohitkumarVaghela, Longchao Da, Duo Lu, Yezhou Yang, Hua Wei. SynTraC: A Synthetic Datasetfor Traffic Signal Control from Traffic Monitoring Cameras. In Proceedings of 27th IEEE International Conference on Intelligent Transportation Systems (ITSC'24).

[6] Xiaoou Liu, Tiejin Chen, Weibo Li, Xiyang Hu, Hua Wei. The Sim-to-Real Gap ofFoundation Model Agents: A Unified MDP Perspective. In the Proceedings of the 32nd

SIGKDD Conference on Knowledge Discovery and Data Mining (KDD'26).

[7] Xiaolin Zhou, Aojie Yuan, Zheng Luo, Zipeng Ling, Xixiao Pan, Yicheng GaoHaiyue Zhang, Jiate Li, Shuli Jiang, Prince Zizhuang Wang, Zixuan Zhu, Jinbo Liu,Ryan A Rossi, Hua Wei, Xiyang Hu. When Simulation Lies: A Sim-to-Real BenchmarkDomain-RandomizedRLTool-UseandRecipeforAgents

https://arxiv.org/abs/2605.11928

[8] Xiaoou Liu, Longchao Da, Hanyang Chen, Yuan Ling, Hua Wei. AndroidReality:How Far Are Mobile Agents from the Real World? https://arxiv.org/abs/2608.07775

[9] Xiaoou Liu, Tiejin Chen, Longchao Da, Chacha Chen, Zhen Lin, Hua Wei.

Uncertainty Quantification and Confidence Calibration in Large Language Models: ASurvey. In the Proceedings of the 31st ACM SIGKDD International Conference on

Knowledge Discovery and Data Mining (KDD'25).

[10]播客:华几来了 https://linktr.ee/huajilaile

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」?

  • 会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航:场馆分布、报告厅怎么走,群里随时问;

    议题共读:热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编:现场海报精华整理,一键收藏不遗漏;

    约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

? 进群传送门:扫码进群或添加微信Qvv0909777,备注:IJCAI+ 单位/学校+姓名+方向。

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
52年毛主席对聂帅发火:下次开会你别来了!好在一干部及时解围

52年毛主席对聂帅发火:下次开会你别来了!好在一干部及时解围

利刃说史
2026-10-02 13:44:53
万万没想到,消失 11 年的李兆会,竟给 44 岁未婚的车晓留下一手

万万没想到,消失 11 年的李兆会,竟给 44 岁未婚的车晓留下一手

卷史
2026-10-04 00:15:08
一架载有6人的飞机在百慕大飞往波士顿途中失联

一架载有6人的飞机在百慕大飞往波士顿途中失联

环球网资讯
2026-10-03 22:09:11
刘欢为啥爱办家宴?高晓松爆料:北京三里屯一件事,让他面子尽失

刘欢为啥爱办家宴?高晓松爆料:北京三里屯一件事,让他面子尽失

秋风悲画芯
2026-10-01 22:44:06
3500亿订单黄了!中方强势取消美芯订单,外媒:封锁开始反噬了

3500亿订单黄了!中方强势取消美芯订单,外媒:封锁开始反噬了

疯狂小菠萝
2026-10-04 13:05:16
CBA最新消息!广东宏远确定大外援,高诗岩或第一阶段报销

CBA最新消息!广东宏远确定大外援,高诗岩或第一阶段报销

体坛瞎白话
2026-10-04 08:39:10
阿曼主帅:我签了4年合同,目标进世界杯

阿曼主帅:我签了4年合同,目标进世界杯

懂球帝
2026-10-04 09:20:05
57岁河南货车司机赴缅甸救重度烧伤儿子,因其身体原因登机受阻,同乡跨国接力出手相助,受伤男子:“当时想着只要能回国,怎么着都行”

57岁河南货车司机赴缅甸救重度烧伤儿子,因其身体原因登机受阻,同乡跨国接力出手相助,受伤男子:“当时想着只要能回国,怎么着都行”

扬子晚报
2026-10-04 09:08:22
最后一笔 100 亿美元汇出去了!孙正义,彻底把命押给了美国!

最后一笔 100 亿美元汇出去了!孙正义,彻底把命押给了美国!

荐史
2026-10-03 13:59:56
5-3领先惨遭逆转,郑钦文再现收视率打法,中网第三轮不好进

5-3领先惨遭逆转,郑钦文再现收视率打法,中网第三轮不好进

南海浪花
2026-10-03 17:33:53
红线有别:郭德纲戏谑红歌与星火社改编《五百年桑田沧海》事件!

红线有别:郭德纲戏谑红歌与星火社改编《五百年桑田沧海》事件!

小椰的奶奶
2026-10-04 09:59:05
比亚迪为什么能重构出行生态格局?

比亚迪为什么能重构出行生态格局?

小眼睛小世界
2026-10-04 04:28:28
震惊!有大学生提议室友上交全部生活费统一保管遭拒,发帖人不解之余,室友视作“舍敌”

震惊!有大学生提议室友上交全部生活费统一保管遭拒,发帖人不解之余,室友视作“舍敌”

火山詩话
2026-10-02 08:52:28
女知青生下儿子后返回城里,50年后,儿子到上海寻母亲当场泪崩

女知青生下儿子后返回城里,50年后,儿子到上海寻母亲当场泪崩

温情邮局
2025-05-28 14:45:51
炸裂!日本妻子拍AV挽救婚姻,瞒夫出道老公崩溃,如今丈夫成粉丝

炸裂!日本妻子拍AV挽救婚姻,瞒夫出道老公崩溃,如今丈夫成粉丝

悠悠说世界
2026-08-17 13:48:27
发现一个奇怪的现象:你吼了孩子,孩子敢顶嘴,说明你这个家庭还有救;如果你不停对孩子吼叫谩骂,孩子一声不吭沉默寡言,那你家庭没救了

发现一个奇怪的现象:你吼了孩子,孩子敢顶嘴,说明你这个家庭还有救;如果你不停对孩子吼叫谩骂,孩子一声不吭沉默寡言,那你家庭没救了

阿呆爸
2026-09-27 21:04:44
3.4 亿退休人员,有人每月 16000 元退休金是什么概念?

3.4 亿退休人员,有人每月 16000 元退休金是什么概念?

白米饭怎么吃
2026-08-22 22:10:21
仅售9万多!新款银河E5变后驱+激光雷达,  首款800V十万级SUV

仅售9万多!新款银河E5变后驱+激光雷达,  首款800V十万级SUV

隔壁说车老王
2026-10-03 08:19:58
迪拜王储到病房亲吻受伤机长额头:他重伤后爬去开门,救下一飞机人

迪拜王储到病房亲吻受伤机长额头:他重伤后爬去开门,救下一飞机人

桂系007
2026-10-03 22:04:20
U23亚运谢幕!11人转入国奥冲奥运,其余球员等待成年国足征召

U23亚运谢幕!11人转入国奥冲奥运,其余球员等待成年国足征召

陈秣爱钓鱼
2026-10-03 21:58:38
2026-10-04 14:20:49
雷峰网 incentive-icons
雷峰网
关注智能与未来!
71182文章数 656254关注度
往期回顾 全部

科技要闻

苹果确认:iPhone 18 Pro Max有问题

头条要闻

中国籍夫妻在澳洲因车祸去世 朋友:两人新房即将完工

头条要闻

中国籍夫妻在澳洲因车祸去世 朋友:两人新房即将完工

体育要闻

“小将”吴曦,中国的莫德里奇

娱乐要闻

杨议没料到,郭德纲如今仍是一呼百应

财经要闻

OpenAI前安全部门员工:公司文化已崩坏

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

房产
时尚
数码
亲子
军事航空

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

秋天衣服不用买很多很贵,这几件衬衫准备好,简约百搭又不挑年纪

数码要闻

小米REDMI电视X RGB-Mini LED 2027竞技版预售,2705元起

亲子要闻

「一孕傻三年」竟是真的?最新研究:孕期雌激素水平升高,拖累记忆,且中晚孕期更明显;激素恢复后,「记忆掉线」可逆转

军事要闻

驻冲绳美军士兵抢劫杀人 日本向美国提出抗议

无障碍浏览 进入关怀版