![]()
公司情报专家《财经涂鸦》获悉,7月19日,“高鹄资本·AI Frontier talks:引领智能新高度、创新智能新形态AI论坛”于2026WAIC期间举行。
现场,逆矩阵科技创始人兼CRO陈博远以《迈向真实物理世界:通用世界基座模型》为主题进行分享。
公开资料显示,逆矩阵科技(Physis)是一家通用世界基座模型公司,致力于让人工智能真正理解和预测物理世界的运行规律,为严肃工业场景、具身智能、物理仿真、交互世界、科学预测等物理AI场景提供通用底层认知引擎。
公司由北大青年学者陈博远以及吉嘉铭联合创立,团队长期专注于强化学习与世界模型研究。
生于2004年的陈博远毕业于北京大学元培学院人工智能方向,本科期间即于国际顶级会议NeurIPS、ACL发表多篇文章并获口头报告、亮点论文等荣誉,谷歌学术引用超 2300 次,获北大学生最高荣誉“五四奖章”。
今年6月份,逆矩阵宣布完成超亿美元种子++轮融资,经纬创投、光合创投、五源资本、BAI资本、钟鼎资本等头部机构共同参与,蚂蚁集团战略投资,老股东高瓴创投、北大系基金燕缘创投持续超额加注,高鹄资本担任独家财务顾问。本轮融资将主要用于通用世界基座模型的预训练研发、及规模化训练体系建设。
以下为陈博远现场分享内容精编:
我们看到,真实世界正在成为AI的新主场,具身智能的物理性变得越来越重要。大家经常会把具身智能等同于物理AI,但在真实物理世界场景中,具身其实是AI进入物理世界一个非常重要的载体。
而今,我们需要面临的问题不再是金融、法律这些简单的垂类场景信息行业,而是实体经济和行业。这时候,世界模型的等号右边已经不再是具身智能,而是整个真实物理学的边界。
如果说语言模型解决是一些知识和语言的能力,那么世界模型就要解决在真实世界中怎样形成一个可以验证、可以行动、可以交互的完整基础设施闭环。
世界模型的核心Feature是Action-Following。类比到自动驾驶的L0到L5,它不仅代表了技术的节约,也就是人的干预性越来越少,也代表着应用市场不断扩大。因此,我们将其归类为W0-W5的6个层次,分别对应视觉与空间形成(W0)、动作条件响应(W1)、物理世界理解(W2)、领域世界模型(W3)、通用物理推演(W4)、自主世界发现(W5)。
当前,W0层的视频模型/3D在解决声音流畅、稳定视觉表现上已经取得非常好的效果,在游戏和影视美术行业里也完成了商业化的闭环;W1层中,像谷歌的游戏交互模型等更在意视觉考量的领域,也形成较好的技术和探索。
但随着AI慢慢进入到更多真实物理场景,我面临的是具身控制、复杂的噪音、嘈杂的灯光以及湍急的人流。模型要在这样一个充满noise的环境里完成决策,必须要懂物理。
关于当前面临的问题,我们有4个关键观察。
首先,真实界每时每刻其实都是部分可观测的。RGB只是2D层面的观测,但物理世界充满了包括几何、材料、接触约束、受力等隐藏变量。
第二,物理世界正在发生稀疏和长尾。真实互联网上可能每天产生几十万小时的视频,但其中只有5%包含了一些简单物理交互,物理突变比如火焰喷发、爆炸等的表现可能又要再小一个数量级。所以,我们很难去照搬文本的Data Scaling方式。
第三,因果产生于动作。从第一性原理讲,人对世界的理解其实来自于交互。比如我们无法直接感知重量,除非尝试去移动一个物体。交互过程中我们在做两个事情,第一不断验证和更新认知,比如一开始我认为杯子放到桌子上是因为有吸力,但是放上去后发现不是,于是我知道这个认知是需要被update的;第二,不断创造和贡献一些稀疏和长尾的数据。
第四,验证比生成容易。我们很容易验证一个数学代码是不是解答正确,我们也很容易验证一个碰撞是否去完全发生,但是我们很难去生成一个符合数学或规律以及代码的特性。
规律是分层次的。语言是第一层规律,而对于物理数学代码中更底层的规律,验证本身是一种更高效的手段。
我们对于世界的建模,并不是一个简单的从无序到有序的过程,也不是一个完全理想状态下的状态转移。它时刻充满了噪音,时刻都是一个部分可观测的状态。因此,真实物理世界的核心痛点不是单点识别,而是在部分可观测、动态变化、后果不可逆的条件下进行安全可靠的闭环决策。
回整个行业,我们要回答问题不是“什么是世界模型”,而是“AI进入真实物理世界时我们需要什么样的基座模型”。我们并不是要去完成对下一个状态的预测或者简单的范式革新,而是在整个真实物理世界中,我们能不能让AI或者具身像人一样完成“从部分观测的感知到在交互中建立对物理世界的认知,最后完成决策”的实时更新的闭环。
简单来说,就是基于当下的状态,我采取什么样的action会导致下一个状态或者未来可能会达成什么样状态的过程。
那么从状态出发,我们要去做很好的压缩。对于学习物理动态来说,很多如像素扩展信息、物体的纹理等高频信息其实本身是一个很大的视觉冗余,且也局部可见的状态,所以我们希望模型要去学会去除冗余,进行更好的重量压缩,尽可能保留我们能够预测未来重力学所需要的特征。
在状态压缩过程中,我们希望建模一个完全和交互环境无关的物体的动态。这样一个对于物体动态的捕捉,它自然而然可以泛化到不同的场景下,不会受特定场景和环境噪音的影响。
如果说prompt或者instruction、token是虚拟世界的基本交互原子,那么对于真实物理世界来说,action就是基本交互原子。目前的一些视频生成模型,对于动作本身的理解都还没有那么准确,比如夹角没有闭合的情况下也能把苹果吸起来。而我们希望模型不只能响应动作,还能理解不同动作的真实物理后果。
所以逆矩阵正在做的事情,是回到第一性原理,解决“如何让模型获得隐性物理直觉”。我们应该回归到最本源的状态,去解决压缩因果以及通过查询验证的过程,将其one for all地应用在不同场景。6月中旬我们曾发布过一个Physis-v0.1的模型,可以为机器人提供物理世界的“大脑”,使其能够在复杂真实环境中自主感知、推理与决策。
遮挡环境中,在长达40秒的时间里,即使物体本身发生了一些遮挡,该模型依然能够稳定地完成具身评测交互的过程。我们希望它能够变成一个通用的世界模型基座,加速智能制造、仓储物流、服务机器人等产业化落地。
未来,我们也希望该模型能应用到科学预测与推演场景,推动AI for Science的基础研究。
我们现在谈论世界模型懂物理时,输出的不应是“看起来像”的视频,而是可以直接用于控制决策的精确物理状态。
一个真正懂物理的精度模型,应该不仅能应用到目前宏观物理学的一些物理资源场景。目前一些仿真预测,甚至很难模拟鞋带穿过鞋孔的场景,尽管这是一个非常日常的场景,因为无法通过书写规则和神经渲染去表征鞋带的运动。
我们希望能通过学习隐式物理,泛化到未见过的物体和交互方式,从“每个场景一套仿真方案”走向“一个通用所有真实物理场景”。
对于逆矩阵而言,我们希望能够构建一个下一代的通用世界模型基座,回归第一性原理,从物理最底层的规律出发,服务一切需要理解物理的场景,探索更多未知的可能。只有当AI理解物理,它才能够真正进入到真实的世界。
以下为高鹄资本合伙人金涛与陈博远的对话:
Q:你怎么看待世界模型路线收敛的路径和时间表,以及作为一个中国公司如何保持处于认知的前沿》?
陈博远:现在世界模型还处在一个百家争鸣的阶段。而一个真正伟大的或者说技术突破的范式,一开始都充满着很多技术路径的探讨和非共识。
我们看到行业正在慢慢收敛,一方面大家越来越认识到,AI本身应该从虚拟世界走向真实的物理世界。比如李飞飞,也从VC回来探讨世界模型发展过程中存在一些困难。
另一方面不同的参与者和技术路径,正在往共同的技术目标去前进。有人通过视频模型出发,有人通过具身的police出发,也有人像我们一样希望回到隐空间解决物理最本源的问题。
但归根结底,我们并不是在比拼谁的模型更能理解物理规律,而是希望这样一个基座模型能被用在真实的产业中,所以验证手段一定是哪条技术路径能够回归第一性上,真正形成一个可以落地、可验证、可闭环、可评测的基础设施。
这个过程中,我们和硅谷经常会有一些闭门的研讨,内部也在和最前沿的同行进行交流和探索,我觉得大家其实是在向一个共同的目标去前进。只有模型在真实物理场景中落地并形成渠道闭环,才能够真正去通往物理的AGI。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.