网易首页 > 网易号 > 正文 申请入驻

具身公司变“老实”:啥VLA、世界模型,我现在只要数据|WRC观察

0
分享至


黄小艺 H997Hbiu

Yoky|yokyliu617

今年 WRC 会场,“概念热”正在褪去。

去年还被反复挂在展台、演讲和采访里的 VLA,今年很少再被当作一个完整答案来讲,“端到端”也退到了更靠后的位置;接棒的新热词“世界模型”,尽管还没有一个确定的答案:有人生成未来视频,有人预测事件,还有人在潜空间里预演,但像去年那种围绕技术路线产生争论的场面也不见了。

更多人开始意识到:所有没有数据支撑的算法路线之争,最后都是梦幻泡影。

无论做 VLA、世界模型,还是端到端具身大模型,最后都会回到数据。没有足够多的真实物理交互数据,VLA 只是把视觉、语言和动作连在一起;端到端只是把模块边界藏进模型里;世界模型也很难真正知道,一个动作之后,世界会怎样变化。

所以今年,问题从“谁才是机器人大脑的最终路线”,变成了更具体的两件事:到底要采什么样的数据?又该怎么采?

我们和行业里重要的6家公司聊了聊,也参考了各家的公开演讲,整理出了四个核心观察。

1

一、VLA 是真的被淘汰了吗?

去年行业还在争论 VLA 是不是机器人大脑的答案。今年更准确的问题变成了:VLA 到底被“淘汰”到了什么程度?从多家公司的回答看,VLA 没有消失,但它正在从独立技术路线,变成系统里的一环。真正被淘汰的,是“只靠 VLA 就够了”的想象。

擎朗智能:VLA是骨架,世界模型让它“先想后做”

行业去年在端到端、VLA、世界模型等路线上确实讨论很多,各有拥趸。但从我们的实践来看,今年已经能看到一些清晰的方向——不是“单靠VLA够不够”的问题,而是如何让VLA真正在真实场景里稳定干活的问题。行业不再争论到底是VLA还是世界模型,而是转向混合架构;世界模型的焦点从“要不要”变为“做在哪一层”。

所以我们的思路很明确:VLA是核心骨架,世界模型是让它“先想后做”的大脑皮层。机器人执行动作前先在内部预演一遍物理结果,预测物体受力后的运动轨迹、多步骤操作的因果链条,从源头规避失败。这不是用世界模型替代VLA,而是用世界模型让VLA更强。

星海图:VLA与世界模型同源共生,最终会走向融合

现在行业有些过度关注技术概念,忽略了技术实质。在我们看来二者内核相通。不管是VLA还是世界模型,本质都是把输入转化为Token,通过Transformer多层神经网络完成编码,再通过自监督方式开展预训练,基本逻辑是一致的。

二者区别仅在于自监督训练的方式不一样,世界模型主要依靠视频预测来做自监督训练。二者同源共生,未来也会走向融合。

乐享科技-元点机器人:单一模型解决不了真实世界,机器人需要一套持续进化的系统

今年行业确实在形成一个更清晰的共识:单一技术路线很难独立解决具身智能在真实物理世界中的全部问题。VLA让机器人具备了从视觉、语言到动作的直接映射能力,是非常重要的基础;但面对家庭等非结构化场景,仅靠VLA往往还不够,还需要数据闭环、任务规划、动作控制、异常恢复以及持续学习机制共同支撑。

元点的路线与行业共识相同的一点,是都认为机器人智能必须从“预设执行”走向“数据驱动”和“持续进化”。不同之处在于,我们不是只围绕单一模型做能力叠加,而是通过OpenBridge这一开源的开发者生态平台把数据平台、训练平台、Skill Hub和Bridge本体连接起来,让能力能够在开源平台被上创建、复用、共享和迭代。

1

二、世界模型是下一个“VLA”概念股么?

所有人都在讲世界模型,但和去年的VLA一样,它还没有形成稳定定义。有人生成未来视频,有人预测动作后果,有人按事件来理解状态变化,还人在潜空间里预演。大家使用同一个词,做的却未必是同一种模型。现在真正值得比较的是它究竟输入什么、预测什么,又怎么影响机器人的动作。

宇树科技:最大瓶颈是,AI模型的输入和输出与真实世界之间仍然存在偏差

今年大家可能听到最多的还是世界模型这个方向。其实我们在2020年初就开始做基于视频生成的世界模型,但是到2020年底,做出来的效果不是特别理想,所以中间稍微搁置了一段时间。从去年开始,我们又重新大力发展基于视频生成的世界模型。

目前全球具身智能最大的瓶颈,就是AI模型的输入和输出,与真实世界之间仍然存在偏差。比如让机器人移动,把一些东西装配在一起,或者把一个物体搬到另一个位置。从大的趋势来看,现在的模型其实没有太大问题,大差不差能够执行你的任务。问题往往发生在最后几个厘米,甚至最后几个毫米。

自变量:VLA回答“做什么”,世界模型回答“做完会怎样”

世界模型接收机器人当前和历史的视觉信息、语言任务、动作及本体状态等数据,预测采取一个动作后,物体和环境将发生怎样的变化。VLA主要回答“下一步做什么”,这部分能力则帮助机器人理解“这样做以后会发生什么”。

两者不是替代关系,也不只是一个模型给另一个模型生成的动作打分,而是会逐渐在统一模型中融合。我们的WALL-WM通过以完整事件对齐视觉、语言和动作,让机器人同时理解动作过程、状态变化和最终结果。

擎朗智能:VLA的架构下,在潜空间里推演物理结果

擎朗KOM 3.0时,我们在VLA架构里融合了潜空间世界模型。

服务机器人面对的不是实验室里固定的桌面,而是餐厅、酒店、咖啡店这种高动态、非结构化的环境。机器人要做的往往是长序列任务——比如做一杯咖啡,要取杯、承接、递送,中间任何一步出错整个任务就失败。如果只靠VLA做“感知-决策-执行”的端到端映射,缺少对物理结果的预判能力,在复杂场景下的成功率会断崖式下降。

机器人执行动作前先在内部预演一遍物理结果,预测物体受力后的运动轨迹、多步骤操作的因果链条,从源头规避失败。

1

三、有多少人工,就有多少智能?

如果 VLA 不是答案,世界模型也不是一个现成答案,那关键问题反而回到了最朴素的地方:数据。去年行业还在讨论算法不行还是数据不够,今年更明确的回答是:数据不够,所以算法才不行。仿真、合成、互联网视频都可以作为补充,但机器人要理解物理世界,最终还是要回到真实交互数据。

奥比中光:无本体数采,要从临时方案变成标准化基础设施

这轮热潮背后首先是真实的数据短板。具身智能模型需要的不只是互联网中的图像和文本,而是大量包含空间、动作、物体状态变化和任务过程的真实世界交互数据。

现阶段,直接依靠机器人本体采集数据,通常面临本体成本较高、部署效率有限、硬件尚未完全定型等问题。无本体数据采集则可以较低成本覆盖更多场景、任务和操作流程,尤其适合采集第一视角下的环境信息、空间关系和长链条任务过程。

这类需求来自多种类型的客户,既包括具身智能模型公司、机器人本体厂商,也包括专业数据采集服务商、数据运营公司以及其他算法驱动型企业。不同客户的共同诉求,是把真实世界数据采集从临时搭建的设备方案,逐步变成可标准化部署和批量交付的基础设施。

智身科技:自研、自采,外部数据无法替代自己的机器人自主运行数据

真人穿戴采集、机器人遥操作、机器人自主运行和仿真数据我们都有在做,因为不同数据源有各自的优缺点。

真人穿戴采集主要用来快速学习;机器人遥操作用来提升操作灵活性;因为智身下半年主打的就是“能干活”,机器人自主运行就是用来提升落地效果,解决真实物理世界中会遇到的各种翻车问题,这个是其它数据源不具有的优势。

仿真数据,量大,能帮我们做场景、任务的多样性扩充,但sim to real的问题让我们没办法把这些数据拿来直接用,都要用真实数据做微调。

对我们来说,缺的不是哪一种数据,其实是“有用的数据”,现在海量的数据里很多其实是“无效数据”。

我们的数据都是自己的,包括数采设备这些,都是自研的。在我们看来,数据质量是一方面,另外是外部提供的数据场景分布不匹配,“它的世界≠我的世界”,数据规模再大,没办法替代我们自己机器人在真实目标场景下产生的交互数据。

自变量:无本体数采扩大数据规模,但不能取代真机数据

当下的这波热潮是“无本体数采”,即不依赖机器人本体,通过头环、手套等穿戴设备等采集人的动作。

无本体数采比真机遥操作更容易规模化,能够以更低成本覆盖更多任务和场景,行业已经基本解决了“能采”的问题,但从数据可回放、可迁移到真正提升模型能力,仍处于早期阶段。自变量推出QUANXTA Zero无本体数采方案,具备全身移动数采和移动采集数据本体回放能力,数据入库有效率超过85%。

但它无法完全取代真机数据,因为人的身体结构和动作方式与机器人不同,也难以完整呈现机器人执行时的接触、误差和失败。

从技术路线上来看,世界模型也可以减少对单一任务真机示范数据的依赖。VLA更需要语言指令、机器人观察和动作轨迹准确对齐的示范数据;世界模型则更关注动作发生前后的连续状态和事件演化,可以使用真机、无本体、视频以及仿真和合成等不同来源的数据。它真正解决的不只是减少数据量,而是提高数据利用效率,让模型学习可以迁移的物理规律,从而提升跨场景泛化和长程任务能力。

擎朗智能:采集到的只是“原油”,真正的瓶颈是“数据炼油”

真人数据无法完全替代真机数据,两者的关系是互补而非替代。

真人第一视角数据可以高效采集人类完成任务的完整过程,用来训练基座模型、构建场景认知和任务理解能力。但最终要让机器人本体精准执行,还是需要真机数据来做后训练微调——因为真机数据包含了机器人特定本体的运动学特性、关节力矩、力反馈这些真人数据里根本没有的信号。

现在采集数据本身不难,难的是让采集到的数据真正提升模型能力。不是戴个头环拍几小时视频,数据就能直接用。从原始视频到可训练的结构化数据,中间要经过去畸变、姿态估计、深度重建、手物分割、自动标注等一系列处理环节。如果这整套“数据炼油”能力跟不上,采集再多原始数据也只是“原油”,没法变成驱动模型的“燃料”。

仿真到真实的“sim-to-real”鸿沟在服务场景里尤其明显——物理引擎再逼真,也模拟不出真实咖啡机出水口的微妙差异、不同材质杯子表面的摩擦力变化、顾客临时伸手干扰操作轨迹这些真实世界的“意外”。

1

四、感知数据能否补位?

今年最先被规模化讨论的,仍然是视觉数据:第一视角、RGB-D、腕部近场、多视角、IMU 和时间同步。但与此同时,触觉、力觉、滑移、材质、接触反馈这些更贴近物理交互的数据,也开始从供应商侧浮出来。

一目科技:视触觉,把每一次接触变成“物理真值”

视触觉路线是最类人的路线。它不是传统力传感器,而是在柔性材料内部建立光学观测系统,当机器人与物体接触时,用图像捕捉材料的微小形变,再把形变转化成压力、摩擦、滑移、软硬、纹理等物理信号。

Physical AI 不能只靠模型继续变大,真正重要的是机器人能不能持续获得来自现实世界的物理真值。每一次接触,都是机器人认识世界的一次学习;每一次抓取,都会产生新的 Ground Truth。

如果世界模型只看视频,它可以学习画面变化,但不一定知道接触瞬间发生了什么。触觉数据的意义,是把机器人和物体接触时的物理结果,也变成模型能学习的东西。一目科技正在做的TouchNet,就是想把真实接触中的压力、纹理、滑动、材质、力反馈这些数据变成可复用的数据基础设施。

帕西尼:触觉既是机器人的能力,也是模型训练的数据

感知是机器人进入物理世界的第一道关口。帕西尼从触觉传感器起步,业务继续延伸到灵巧手、本体、数据集与模型,希望把感知、决策和执行连成一套完整技术生态。

帕西尼同时在做两条线:机器人端的触觉传感器和灵巧手,以及真人穿戴的数据采集系统,让真人佩戴触觉采集手套完成任务,同步记录触觉、视觉和动作轨迹等多模态信息,以更高效率覆盖真实场景。

比如拿起杯子、拧螺丝、整理衣物,都依赖稳定、可控的接触。在这些精细操作中,触觉已经成为基础能力:它既影响动作能否成功,也能为模型记录接触产生的物理结果。

奥比中光:硬件决定数据质量的起点和上限

今年我们推出 EGO、UMI、WristCam 和 Hub,是希望覆盖真实交互里的关键视角。EGO 主要解决第一视角和环境空间信息采集;WristCam 和UMI更靠近手部及操作区域,用于补充腕部近场观察、遮挡条件下的手-物交互细节;Hub 则负责多设备同步。客户往往不是单独选择某一种设备,而是根据任务、视角和数据模态,把不同设备组合成采集方案。

从客户价值看,客户最终需要的当然不是设备本身,而是能够有效提升模型能力的数据。但“可训练的数据”并不是从采集完成之后才开始形成的。传感器配置、视角设计、深度质量、时间同步和标定精度,都会直接决定后续数据能不能用,以及需要付出多大的清洗和修正成本。

所以客户表面上购买的是硬件和定制服务,实际付费的是一种持续获得高质量、可复用训练数据的能力。硬件不是最终目的,但它决定了数据质量的起点和上限。

目前行业已经基本跨过“能不能采到数据”的第一阶段,正在进入“采什么数据、如何评价数据、哪些数据真正提升模型”的阶段。下一步竞争重点不会只是设备数量或数据总量,而是数据是否具备准确的空间信息、完整的任务链条、稳定的多模态同步,以及能否通过训练结果证明其有效性。

未来的世界模型如果真的要理解物理世界,触觉和力觉不太可能只是控制系统里的边缘信号。它们会变成世界模型的一部分。

在今年人挤人的WRC上,你反而感到具身公司们变得安静了,关于算法的争吵让位给同一件事:采数据。

过去两年,行业习惯把具身智能理解成给大模型装上一副身体:摄像头负责看,关节负责动,灵巧手负责执行,所有人的注意力都放在“大脑”上。

等机器人真的开始进入餐厅、仓库和家庭,身体反过来卡住了大脑。最后几厘米的偏差、接触瞬间的滑移、不同杯子的摩擦力,都无法从语言和互联网视频里直接长出来。身体过去更像模型的输出接口,现在开始成为智能的输入源。

所以,今年展馆里真正的变化,发生在那些最不像“大脑”的地方:头环、腕部相机、触觉手套、灵巧手、遥操作台和数据工厂,在找到终极路线之前,先一条条地把物理世界喂给模型。



点个爱心,再走 吧

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
血亏甩卖!皇马致命决策失误!600 万放走世界级青训天才

血亏甩卖!皇马致命决策失误!600 万放走世界级青训天才

澜归序
2026-08-21 08:23:07
“AI写的代码,我完全不看”,世界级编程大师Bob大叔警示:说软件基础不重要的人会吃苦头,不会等太久

“AI写的代码,我完全不看”,世界级编程大师Bob大叔警示:说软件基础不重要的人会吃苦头,不会等太久

CSDN
2026-08-21 19:20:23
差三岁判若两代人!48岁黄晓明45岁陈冠希罕见同框,差距太真实

差三岁判若两代人!48岁黄晓明45岁陈冠希罕见同框,差距太真实

观鱼听雨
2026-08-21 19:44:40
冯巩现状:全家住北京老破小,68岁满脸褶子,儿子已是公司高管

冯巩现状:全家住北京老破小,68岁满脸褶子,儿子已是公司高管

揽星河的笔记
2026-08-20 14:35:02
太尴尬了!网传安徽有高校老师陷入“无课可上”困境,选课人数不足30人的课程不予开设

太尴尬了!网传安徽有高校老师陷入“无课可上”困境,选课人数不足30人的课程不予开设

火山詩话
2026-08-21 18:01:15
北京胜德国球队!范子铭+雷蒙轰40分,翟晓川划水,李楠应变不错

北京胜德国球队!范子铭+雷蒙轰40分,翟晓川划水,李楠应变不错

篮球资讯达人
2026-08-21 20:35:03
拒绝乌克兰副总理,费多罗夫:除防长不干,喊话泽连斯基举行选举

拒绝乌克兰副总理,费多罗夫:除防长不干,喊话泽连斯基举行选举

吃货的分享
2026-08-22 01:49:00
国家发改委主任,与5家企业座谈

国家发改委主任,与5家企业座谈

政知新媒体
2026-08-21 21:36:05
今日票房!前三毫不意外,《牛来》累计票房超3500万!

今日票房!前三毫不意外,《牛来》累计票房超3500万!

情感大头说说
2026-08-22 02:05:33
重磅!新学年北京中小学教材“变脸”!这些学科改动大

重磅!新学年北京中小学教材“变脸”!这些学科改动大

京城教育圈
2026-08-21 23:50:49
朱德元帅唯一题写的大学校名!十分罕见!浑厚大气!完胜书法家!为什么现在年轻人都不愿去学习书法?

朱德元帅唯一题写的大学校名!十分罕见!浑厚大气!完胜书法家!为什么现在年轻人都不愿去学习书法?

书画相约
2026-08-21 09:47:22
别克新车官宣:8月19日,正式上市

别克新车官宣:8月19日,正式上市

科技堡垒
2026-08-19 11:59:19
菲律宾输球又输人!球迷场下无德球员场上丢份儿 王建军喷菲教有理

菲律宾输球又输人!球迷场下无德球员场上丢份儿 王建军喷菲教有理

颜小白的篮球梦
2026-08-21 15:34:53
王证26分,山东高速热身赛97-100憾负考辛斯领衔的肯塔基队

王证26分,山东高速热身赛97-100憾负考辛斯领衔的肯塔基队

懂球帝
2026-08-21 23:21:07
白月光的杀伤力有多大?网友:白月光就是没得到的人,得到了也就那样

白月光的杀伤力有多大?网友:白月光就是没得到的人,得到了也就那样

带你感受人间冷暖
2026-08-20 00:18:45
韩国给中国提了醒,中国严管的精炼稀土,被俄罗斯转手卖给韩国?

韩国给中国提了醒,中国严管的精炼稀土,被俄罗斯转手卖给韩国?

浯江孤舟
2026-08-17 13:07:27
医生再次提醒:明年开始,75岁以上长者请提前做好这6项生活准备

医生再次提醒:明年开始,75岁以上长者请提前做好这6项生活准备

荆医生科普
2026-08-21 18:15:14
华为Mate 90 Pro Max再曝:麒麟9050 Pro+7000mAh!

华为Mate 90 Pro Max再曝:麒麟9050 Pro+7000mAh!

科技堡垒
2026-08-19 11:57:33
杭州酒局后,郁某栋的“免职”才刚刚开始

杭州酒局后,郁某栋的“免职”才刚刚开始

笔墨V
2026-08-22 01:56:53
体育总局开展专项严查,王楚钦被卷入风波,多名运动员受事件影响

体育总局开展专项严查,王楚钦被卷入风波,多名运动员受事件影响

瓜农娟姐
2026-08-20 15:43:06
2026-08-22 06:00:49
硅星人 incentive-icons
硅星人
硅(Si)是创造未来的基础,欢迎来到这个星球。
3346文章数 10526关注度
往期回顾 全部

科技要闻

阿里AI的两面:云赚56亿,千问烧掉138亿

头条要闻

30岁女干部突遇洪水不幸牺牲 更多细节公布

头条要闻

30岁女干部突遇洪水不幸牺牲 更多细节公布

体育要闻

续哈登+招沃特森=骑士赌了

娱乐要闻

冯绍峰七夕带儿子游玩!次日聚会

财经要闻

蔡昉解读经济:扩大消费需求的政策思考

汽车要闻

2026成都车展:小鹏全阵容亮相 三款新车套件上新

态度原创

亲子
艺术
时尚
本地
军事航空

亲子要闻

可爱宝贝哈哈哈哈哈哈哈

艺术要闻

许家印倒台之前收到两幅字,网友:一个真敢写,一个真敢收啊!

全网全文背诵:阿姨你找谁啊?

本地新闻

《牛来》的一声“妈妈”,到底多少人被精神污染了

军事要闻

俄在争议岛屿附近进行导弹训练 日本:无法接受

无障碍浏览 进入关怀版