来源:市场资讯
(来源:即智Ultra)
![]()
让机器人真正实现 “像人一样工作”。
即 智 U l t r a
近日,北京智源大会现场具身智能的技术路线之争再次成为行业焦点。智平方创始人兼 CEO 郭彦东针对行业热议的世界模型与 VLA 技术路线之争给出明确回应,并发布新一代类脑具身智能系统,梳理出机器人大脑清晰的演进路径,为具身智能发展指明方向。
近一年来,业内围绕机器人该选择 VLA 还是世界模型路线争论不休:一派主张依托世界模型构建机器人对物理世界的认知,另一派认为 VLA 凭借视觉、语言直连动作,落地效率更高。
郭彦东指出,二者并非竞争对立关系,而是有机整体,世界模型是 VLA 体系的核心组成。从行为逻辑来看,生物先感知理解环境,再做出行动,对应世界模型负责 4D 空间与短程物理状态预测,VLA 承担多模态融合与动作输出;前者可补足真实场景稀缺的边缘数据,还能配合 VLA 完成长程任务规划,二者融合是技术必然。
解决 “看懂世界” 的问题后,机器人如何实现稳定、高效、类生物的行动,成为下一阶段核心挑战。当前多数机器人依靠单一模型统筹感知、推理与控制,普遍存在动作抖动、响应滞后、功耗偏高等问题。
![]()
对此,智平方推出全球首个类脑具身智能系统 NeuroVLA,创新搭建 “皮层 — 小脑 — 脊髓” 三级类脑架构,复刻人脑分工机制:皮层负责语义理解与高层任务规划,小脑完成运动协调与轨迹实时修正,脊髓实现毫秒级执行与安全反射。
基于该理念,智平方联合北京大学在 2025 年 11 月推出融合 4D 世界模型的 Video2Act 架构,打造 “先预测、后执行” 的全新机器人模型范式。
该架构通过空间与动作时序建模,将世界模型的预测能力转化为行动决策,第三方评测显示其性能较海外标杆模型领先超 30%,也被全球权威世界模型综述列为 “世界模型 + VLA 融合路线” 代表性成果,标志着两大路线之争迈入融合发展新阶段。
实测数据显示,NeuroVLA 可将机器人动作抖动降低 75.6%,碰撞反射响应控制在 20 毫秒以内,同时大幅降低硬件功耗,也是目前唯一集成主动感知、故障自恢复、时序记忆三大生物运动能力的具身智能系统。
该成果跳出单点算法优化,从底层架构重塑机器人大脑,让机器人从单纯 “推理决策” 进阶到拥有生物级本能反应。
最后,回顾智平方三年技术布局,从端到端 VLA、融合世界模型的 Video2Act,再到类脑架构 NeuroVLA,完成了机器人大脑的三次关键升级:VLA 赋予机器人行动能力,世界模型强化环境理解与预测能力,类脑架构实现类生物的控制与反应能力。
当前,全球大脑玩家陷入同质化内卷,模型价值定义正在重构,行业竞争重心,从浅层视觉生成内卷,转向底层物理智能能力的长期比拼。而智平方整体技术演进始终围绕核心目标:让机器人真正实现 “像人一样工作”。可以说,郭彦东给出的不仅是一套技术方案,更是一条关于下一代机器人大脑的演进路线。
![]()
![]()
*编者申明:本文部分内容来源网络,涉及观点仅供交流和分享。如有侵犯,请及时与我们联系。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.