![]()
近日,在 WAIC 现场,清华大学车辆与运载学院、人工智能学院教授李升波发表了题为《迈向泛在具身智能之路:物理原生的世界模型、数据结构与训练算法》的主题演讲,提出了“物理原生智能”(Physics-native Intelligence, Phi)的概念,并系统阐述其核心特征与技术体系,为破解具身智能的根本性难题提供了全新范式。
![]()
李升波指出,物理原生智能具备三项核心特征。第一,利用状态而不是观测表征世界且状态需要解耦:系统的状态由物理模型的“显状态”和神经网络的“隐状态”两部分构成,兼顾准确性与泛化性。第二,模型结构满足时序性和因果性:遵循时序优先的原则,原因先于结果,动作规划尽量减少对未来信息“预测”的依赖。第三,训练过程须嵌入底层物理规律的约束,例如对称性和守恒性,以及动力学系统的辛几何结构等。
以下内容根据李升波教授现场演讲整理,略有删节:
人工智能是这个时代最热门的主题,也是最重要的技术方向。过去十年,人工智能领域出现了一系列里程碑事件,从 ResNet,到 AlphaGo,再到 ChatGPT,DeepSeek,每一次都引起全世界的广泛关注与热议。
![]()
我们探讨 AI,研究 AI,开发 AI,到底追求什么?我想大家的目的是一致的,是让智能更加“通用化”。唯有具备通用的能力,才能叫做智能。若想称一个系统具有智能,也只能靠它的“通用化”能力才能证明。到今天为止,无论是视觉智能、语言智能,还是融合视频、图像、文本的多模态智能,实际上都在追求“通用化”这一目标的。
![]()
作为人工智能的当前热点,具身智能也是以通用化为目标的。什么是具身智能呢?人类就是具身智能的典型代表。类似人类与周围环境的交互,具身智能体要与物理世界进行交互,通过感知这个世界,做出合乎逻辑的决策,然后执行一定的动作,进而影响这个世界的某一实物对象。具身智能体影响的物理实体越多,它的通用化能力就越强,智能性也就越好。
![]()
具身智能并非一个全新的概念,汽车领域的工程师是最早的开拓者与实践者。自动驾驶是首个量产化的具身智能系统,机器人是当前大家关注的重点,未来世界或许将与一切可交互的物理实体进行接触,这将是泛在的具身智能世界。
![]()
然而,通用化的具身智能容易开发吗?我的感受是挑战是巨大的,比视觉、语言领域更加困难。大家都知道,自动驾驶汽车即使到今天,其智能性远未达到人类驾驶员的水平,功能限于 L2 级驾驶辅助,尚未达到 L4 级的能力。与汽车相比,机器人的自由度更高,场景结构更复杂、交互对象更多样,如何开发它的通用具身智能体,是摆在学术界、工业界全体同仁面前的重大难题。
具体而言,这两类对象仍然以端到端模型训练为主要技术路线。从目前的实践看,汽车大概需要百亿级别的网络参数、亿级的驾驶片段,而机器人考虑到它的本体、场景更加复杂,大概需要万亿级别的网络参数,千亿级别的交互片段,训练难度至少是汽车的十倍以上。若仍然沿用现有的视觉、语言、多模态大模型训练思路,我们能否达到通用化的目标呢?答案是显而易见的,不具有可行性。
![]()
十分幸运的是,过去六十年,人工智能领域的先贤圣哲们给了我们很多启发,让我们从另外一个角度思考智能的开发范式。比如说:McCarthy 建议重视世界的一般性表征,Pearl 告知我们要考虑人类认知的因果关系,Hopfield 曾说嵌入物理系统的集体属性。以这些大师们的思想为基础,结合近十年人工智能的技术进展以及具身智能的应用需求,我们逐步形成了“物理原生智能”的概念、特征与技术体系,今天向大家进行系统性的介绍。
物理原生智能是一类更依赖物理规律,且以与物理世界更好地交互为目的的具身智能。它仍然以数据驱动的端到端模型训练为基本架构,但是从世界模型、数据结构和训练算法三个维度,更加深入的考虑物理实体对智能的客观要求,包括物理世界的数据是稀缺的、功能安全性要求是更高的,模型训练是追求稳定性和长期性的。具体特征包括以解耦的状态表征系统动力学,而非传感器的观测值;满足时序性和因果性的隐式模型结构设计;采用底层物理规律规范化模型的训练过程,以更好地与物理世界的特性相匹配。我们将这类智能称为 Physics-native Intelligence,简称 Phi。
![]()
具体来说,第一个特征要求系统的状态是由两个部分构成的:显状态 - 服从系统动力学与物理约束,状态转移长期稳定。隐状态 - 服从物理规律驱动的受控转移,长期推演不漂移。第二个特征要求:时序优先 - 原因先于结果,状态预测不得依赖未来信息。干预敏感 - 改变动作输入,后续状态应产生可解释差异。反事实 - 不仅关注正样本,而且关注负样本的信息收益。第三个特征要求:对称守恒 - 由对称性决定的物理量应守恒或受控变化。结构保持 - 训练动力学应保持几何结构和能量收支规律。
![]()
物理原生智能需要全新的训练范式,一方面需要使用虚实混合的数据,解决物理世界数据缺少、匮乏的难题。另外一方面,将彻底采用阶梯训练技术,步步为营,逐步升级的提升性能,而不是指望某一个训练方法,将性能一蹴而就提升至 100%。建议将训练过程至少分为三个阶段,首先是监督学习预训练,然后强化学习后训练,再使用强化学习真机微调的方式。每一个阶段所采用的数据列表、性能指标、训练算法均有所不同,根据实际情况进行调整。
![]()
当然仅有基本特征和训练范式,还远远不够,我们还是不知道如何开发“物理原生智能”。下面我将从世界模型、数据结构、训练算法,介绍这一智能的具体开发方法。世界模型是物理原生智能的核心。从朴素世界模型、到世界动作模型以及受控世界模型,面向具身智能的一个核心问题是如何增加动作输入,让模型真正可影响物理世界。世界动作模型的思路是增加逆动力学模型,通过未来的状态与动作进行关联。受控世界模型的思路是直接增加一个动作维度。然而,这两者都存在一个问题是,长程化、精细化、高稳定的动作输出并不理想,且与强化学习等类脑训练算法的匹配度不高。
![]()
物理原生世界模型的设计更加强化因果律的满足,以显式、隐式两类状态为转移动力学核心,前者直接嵌入物理动力学模型,而后者将采用神经网络构造物理模型。从观测到状态,采用已有的编码器机制,便于更好地利用现有大模型领域成果。将策略模块、评价模块直接与状态关联,而不是观测,这类结构化的信息输入,有利于提升模型的动作准确性、功能安全性与可解释性。
![]()
数据层面,从当前观测到下一个观测的转移数据是基础。同时需要增加奖励信号 r,以及人类的经验知识 K。这是物理原生数据的三要素。无论是互联网的视频数据,还是 Ego/UMI 数据,以及真机操作数据、仿真合成数据,均可以通过一定的数据重构、时空对齐和质量增强方式,转化为结构一致的物理原生数据。
![]()
各个数据分量与模型训练怎么结合呢?转移特性,主要用于支撑编码器、解码器、受控转移模块的训练,并提供部分的策略性能。奖励信号,则以强化学习为主,支撑评价模块,并进一步提升策略性能。而人类的经验知识,则通过大模型的评价能力,嵌入到受控转移模型或评价模型,为世界模型的性能提升提供支持。
![]()
将数据信息注入模型,还需要算法的支持。物理原生算法的设计,第一个要求是嵌入训练动力学的底层规律,尤其是结构对称守恒的特性。神经网络模型的训练过程,本质上是一个动力学系统的离散状态演化过程。类似于物理世界的动力学,训练动力学也存在广义能量守恒、辛几何结构保持等底层规律,如果能够将这些性质强制嵌入训练算法设计,将极大提升训练系统的稳定性。
![]()
第二项要求是绝对安全保障能力。绝对安全性是具身智能模型训练的特殊要求,它是指真机训练过程,每一代模型都满足安全硬约束。就像人类新手学习开车的过程,不能只是学会了之后才开车安全,学习驾驶的过程中也要保证安全。从理论上说,若想达到这一要求,就要同时训练每一代最优策略以及它所运行的可行区域。而可行区域的扩大,又与智能体对环境的认知不确定性是互相制约的关系,需要通过博弈机制达到均衡状态。这是保障绝对安全的基本原理。
![]()
训练算法的第三项客观需求是抗遗忘,这是类似于人类学习过程的能力。正是因为具身智能的数据比较稀少,应用场景繁多,且每个任务对性能要求又比较高,训练过程只能是多阶段分步骤实施,让性能持续进化提升,而不能指望一次性训练解决所有问题。因此,如何让每一批的数据都有用,后面的训练不要忘记之前的性能,是训练算法的基本要求。设计的关键在于抗遗忘条件以及梯度正交机制的构建。
![]()
围绕物理原生智能的技术框架与核心思路,我所在清华大学研究组在过去十年开展了一系列核心算法的创新研究。我们自主研发了面向具身智能的通用训练平台 GOPS(General Optimal Control Problem Solver)。平台以用户定义的任务和约束为输入,自主组织训练数据生成、对象与环境建模、任务转化、网络构建、优化求解、参数调优、代码部署和控制器集成,形成从模型研发到端侧应用迭代的全流程闭环,旨在降低具身智能系统的开发门槛,提升模型训练、调优与部署效率。
![]()
GOPS 内嵌了一系列覆盖强化学习、模型优化、安全训练、状态估计与大模型微调的物理原生算法:DSAC 通过连续值分布建模缓解策略高估问题,提升中小规模强化学习的稳定性;RAD 将辛结构守恒融入自适应优化器,抑制异常梯度引发的参数更新振荡;LipsNet 结合傅里叶滤波与李普希兹约束,缓解神经网络策略的动作震荡;RACS 构建安全强化学习的三元迭代框架,通过可行域内外的差异化更新,实现安全区域的单调扩展与策略收敛;DACER 将反向扩散模型嵌入在线策略迭代过程,支持多模态动作生成并缓解策略分叉难题;BOOM 采用规划自学习驱动的世界模型强化学习机制,兼顾算法稳定性与复杂控制性能;NANO 依托自然梯度下降构造几何约束的非线性高斯滤波器,提升复杂系统的状态估计能力;MVP 引入瞬时速度约束和复合生成与选择机制,兼具生成式策略的高表达能力与单步生成的高时间效率。
![]()
人工智能的时代刚刚来临,方兴未艾。目前我们看到信息智能已经如火如荼。具身智能正在路上,物理原生智能为我们从自动驾驶走向机器人、走向更加广泛的物理实体,进而迈向泛在具身智能,提供了一条值得持续探索的技术路径。或许在不远的未来,我们能够看到人机交互、人机接口,能够在蛋白质领域、基因领域和量子领域做出跟人类相提并论、等量齐观的智能。
会议推荐
做 AI 的谁还没点技术焦虑,来 AICon 深圳站,吃颗技术定心丸! 大会限时 9 折专属优惠,现在报名立减 580,更多详情可扫码或联系票务经理13269078023 进行咨询。
今日荐文
你也「在看」吗?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.