![]()
![]()
出品|搜狐科技
作者|梁昌均
“现在还没有出现能用的具身智能模型。”这是搜狐科技此前与多位业内人士交流时得到的普遍结论。
但最近美国百亿美元具身独角兽Figure AI似乎让这件事现出了一点曙光。
这家公司把搭载最新模型Helix 2.5的人形机器人放到了30栋陌生房子中,执行整理客厅、折毛巾和整理床铺三种长时序任务。
实测显示,Helix 2.5能让机器人零样本自主作业,任务成功率从8%提升到56%,且展现出更强的泛化能力。这意味着具身智能可以像人一样,对物理世界的理解实现环境迁移。
过去很长一段时间,具身机器人往往仅能在固定的训练场景发挥作用,一旦环境改变,任务成功率就会大幅下降,泛化性成为一大瓶颈。
最近具身智能引发的商业化争议,很大程度本质就在于技术能力,尤其是机器人大脑能力的不足。过去两年,这个行业吸引了上千亿资本,但至今还未造出机器人能用、好用的具身模型。
围绕具身智能争议,搜狐科技将推出多篇深度解读报道。本文主要解读具身智能模型现状、技术路线和核心瓶颈,以及业内如何突破。
![]()
未到终局的技术路线
这波具身智能的热潮很大程度上始于ChatGPT诞生后引发的大模型热潮。当文字、图像、视频等都可以在数字世界生成时,业内也开始关注大模型如何在物理世界发挥作用。
由此国内外诞生了一批具身智能的创业公司,高校教授、大厂高管、天才少年,以及自动驾驶和上波机器人的创业者,都纷纷扎到这个赛道,催生了数十家估值超百亿的明星公司。
但必须要清醒认识到,过去机器人各种表演的花活儿,如跳舞、打拳等很大程度依然是本体和小脑的能力体现,要想进工厂、进家庭,则更需要大脑的能力,也就是通用的具身模型。
但技术变化太快了。搜狐科技从多位从业者了解到,具身模型在过去三年多的时间经历了多次技术范式的转变。
最初是大语言模型+机器人传统的模块化控制,而在GPT-4等多模态出现后,行业开始在语言基础上融入视觉等,VLA(视觉语言动作模型)由此成为行业主流。
但随着世界模型的火热,以及行业大佬杨立昆、李飞飞等人的入局,具身智能领域的WAM(世界动作模型)也应运而生,不少公司正靠着世界模型的概念疯狂吸金。
从大模型外挂,到端到端,再到先预测、后执行的世界模型,具身智能的技术路线快速演化。目前,业内也基本形成世界模型和VLA并非是替代关系的共识。
智平方创始人郭彦东就认为,世界模型负责理解世界,VLA负责作用于世界,两者并非对立,而是天然统一的整体。
星海图CEO高继扬此前也对搜狐科技表示,VAL和世界模型是同源共生,未来需要结合各自优缺点去融合。“现在可能大家对技术名词这种概念性的东西太过关注,但技术实质都一样。”
然而,这种本质依靠数据驱动和统计预测的模仿学习方式可能依然不是终极的路线。
光象科技首席科学家吕尧对搜狐科技表示,VLA模型的架构存在根源性问题,目前行业也意识到其存在瓶颈,如在环境理解和长程任务推理方面的性能已接近上限,因此很难实现真正的通用泛化。
星动纪元创始人陈建宇也提到,VLA模型的局限性在于泛化性相对有限。“让它学会这个事情,需要给大量数据,但新的任务没有进行模仿很难直接举一反三。”
他认为 ,现在世界动作模型很多是以视频模型为底座,而视频模型直接处理原始图像、视频等数据,其中包含丰富的物理世界细节的东西,这是更加适合物理世界操作的具身模型。
不过,吕尧认为,现在的世界动作模型本质是以预测未来动作生成为目标,还有一个关键问题没有被充分解决:模型是否学会了客观的物理规律和动作引起的因果效应,并基于此进行性能优化。
因此,吕尧所在的团队则提出了物理原生世界模型的路线,并认为这是未来能够实现通用具身智能最正确的一条路线。
可见,目前具身智能模型的技术路线仍未收敛,世界模型如何理解物理因果仍是行业难题。新概念也加剧了行业的混乱,有人在潜心研发,也有人是为了故事和融资。
![]()
单纯刷榜没意义
今年以来,多家企业陆续发布了自研的具身模型。不少企业模型喊出全球首发,并在行业评测榜单上达到全球前列。
宇树、智元、自变量、智平方、星海图、千寻智能、银河通用、星动纪元等头部具身智能公司都在研发或发布了和VLA融合的世界模型,不少企业还宣布开源。
然而,这些模型的真实能力无法得到有效验证,在实际商业场景的表现如何也难以被外界感知。因此,评测榜单就成为秀实力的方式,前述不少企业都发布过模型登顶国际榜单的消息,各种“第一”屡屡出现。
业内人士提到,目前国内外的具身智能模型评测平台至少有十几个,侧重方向也有所不同,比如仿真评测或真机评测,缺乏真正具备公信力和价值体现的榜单。因此,业内对企业刷榜的质疑也不少见。
比如,千寻智能的Spirit v1.6此前在登顶RoboArena后就被发现评测数据存在异常,与英伟达等机构的评测结果差异也较大。随后官方移除可疑数据后更新榜单,Spirit v1.6排名消失。
RoboArena是由加州大学伯克利分校、斯坦福大学及英伟达等联合发起的具身智能机器人评测平台,评测框架、数据流与排名算法全量开源,被称为北美具身智能的“奥林匹克”。
搜狐科技查询到,目前RoboArena官方榜单中,英伟达DreamZero冲到第一,TOP9基本被Physical Intelligence的Pi模型和谷歌DeepMind的PaliGemma模型占据,未有中国模型出现。
![]()
业内有观点认为,不同于相对容易评测的大语言模型,具身模型和硬件本体、物理世界高度关联,能力评测难度更大,很难通过榜单去判定其在实际场景的能力表现,导致行业容易陷入自说自话。
“评估世界模型不能只看下一帧像不像,还要看动作一变,模型是否能正确解释世界为什么跟着变。”吕尧提到,这也是目前评测中所缺乏的部分。
在光象科技创始人、CEO张涛看来,企业去做榜单本身不是问题,虽然目前的榜单还不够完善,但总得有东西去评价,所以很多企业也不得不参与。
“现在的问题是缺少一个真正被大家认可榜单,如果具身领域也出现类似像李飞飞团队原来做的那种规模足够大、能全面评价模型能力的榜单,对行业会有巨大推动作用。”
但这可能是个吃力不讨好的事,谁来牵头做,以及针对不同技术路线如何科学设计评测基准,同样是行业挑战。
![]()
通用大模型降维打击?
对于具身模型何时能够突破,目前业内没有共识。
宇树创始人王兴兴判断,具身智能的ChatGPT时刻,快则两三年,慢则五到十年,有望迎来关键突破。对此,他也给出了清晰定义。
即当机器人无需提前定制调试,可以自主适配各类陌生家庭环境,仅靠人类语音、文字指令,就能独立完成80%左右的日常居家任务。这就意味着具身智能实现跨越式突破,也标志着人形机器人产业迎来爆发窗口期。
银河通用创始人王鹤多次提到,其具身模型的ChatGPT有望在2028年实现。
他对这个时刻的定义是,在人类不需要特殊学习的任务上到达70%-80%的成功率,然后进一步去扩大数据、进一步提高算力规模,从而通过后训练训出成功率100%干活的模型。
过去几年,大语言模型借助Scaling Law持续突破,而业内认为,这在具身模型依然适用。
但目前数据依然是具身模型Scaling Law发挥的瓶颈。这不仅在于数据的多寡、质量高低,还在于如何用好互联网、合成、真机、遥操等不同类型的数据。
吕尧认为,现在具身模型的数据总量肯定不足,但更核心的问题在于如何把数据用得更好,即数据职能如何划分,行业目前还没有统一的最佳判断。
他提到,目前业内常见做法可能是将各类数据混合使用,这容易产生矛盾,从而导致模型性能下降。因此,必须明确区分不同数据对模型能力提升的帮助,并将其安排在不同阶段。
搜狐科技注意到,目前国内外的具身模型规模普遍较小,参数多数集中在1B-5B规模。对比来看,大语言模型则从ChatGPT发布时的千亿参数,如今已进化到万亿,甚至有企业计划研发5万亿-10万亿参数的模型。
业内认为,模型能力要充分发挥,需要匹配相应量级的数据。现在没有足够数据将具身模型“喂饱”,就没有必要将模型做得过大。
“但从长远看,物理世界需要处理的信号比语言世界更加复杂,理解难度更高,未来通用的具身智能基模参数量可能会超越当前语言模型的量级。”吕尧判断。
这意味着,算力也将是瓶颈。目前,具身智能行业整体算力保有量相对较低,同时又被分散在不同验证路径上,导致训练模型时算力受限,国内公司对此投入也不够。
Figure AI透露,将投入价值35亿美元的算力资源用于训练Helix模型,已与AI基础设施供应商锁定了约10万块英伟达Vera Rubin系列算力供应,并呼吁“是时候扩大规模了”。
在自身瓶颈之外,具身智能企业还可能面临通用大模型的技术压力。
最近OpenAI发布的GPT-6 Astra对机器人的控制就引发了业内对通用大模型是否会降维打击具身模型的讨论。这家公司的CEO奥特曼还明确表示,未来会布局人形机器人。
多数从业者认为,通用大模型学到的是通用知识,并没有按照具身模型所需的模型结构、训练方式和数据职能进行学习,自身积累存在竞争优势。
在破壳机器人创始人许华哲看来,通用大模型在语义泛化、空间泛化上的能力表现较好,但在物理交互维度能力很弱,它和具身模型也不是替代的关系。
“上层大模型负责语义与推理,下层具身模型负责物理操作,再衔接真实物理世界,三者形成完整闭环,才能真正解决问题。”
参考通用大模型,其从关键架构的提出到真正突破花了五六年时间。面向物理世界的具身模型,可能会需要更多的耐心。
![]()
![]()
运营编辑 | 孟莎莎
![]()
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.