IT时代网6月16日消息,千问大模型团队正式发布Qwen-Robot系列,包含三款基础模型——Qwen-RobotNav、Qwen-RobotManip与Qwen-RobotWorld,分别对应物理智能体的导航、操作与世界动态预测能力,标志着Qwen从数字世界迈向物理世界的关键一步。
千问团队指出,视觉语言模型虽已能解析空间关系、识别物体并完成语言层面的规划,但理解物理世界与在其中行动是两回事。语言指令与物理动作处于不同表示空间,仅凭感知无法跨越;而具身数据天然异构、采集成本高、多样性有限,简单混合只会产生冲突而非协同。Qwen-Robot系列正是为弥合这一鸿沟而生。
Qwen-RobotNav定位为物理智能体的行动入口,通过可控观测编码和工具接口,将视觉语言能力接入移动控制,以单一模型、单组权重统一了指令跟随、点/目标导航、目标追踪和自动驾驶五类任务。模型在1560万条样本上训练,在VLN-CE RxR达到76.5% SR、HM3Dv2目标搜索75.6% SR(仅RGB超越所有深度方法)、NAVSIM 91.4 PDMS等多项SOTA。该模型已在Unitree Go2四足机器人上实现零样本真实环境部署。
Qwen-RobotManip作为物理智能体的交互基石,以统一80维状态-动作表示兼容单臂、双臂、灵巧手和移动平台等多种本体,通过相机坐标系下的末端执行器增量位姿屏蔽形态差异。模型基于完全由开源数据构建的超38100小时语料库训练,在LIBERO-Plus达91.4%、RoboTwin-Clean2Rand Hard达69.4%,RoboChallenge Table30通用赛道以45% SR排名第一,较此前SOTA提升20%。团队发现,只有具备统一跨本体表示的模型才能展现稳定的数据规模化曲线——对齐是规模化的前提。
Qwen-RobotWorld则通过自然语言动作接口,让同一个世界模型跨越操作、驾驶和导航场景预测符合物理规律的未来。860万视频-文本对、逾2亿帧的具身世界知识语料库支撑训练,60层双流MMDiT将Qwen2.5-VL语义表示与视频隐变量深度耦合。以完整多模态大语言模型作为动作编码器,内化了手臂刚体、液体扩散、物体下落等物理常识,在EWMBench总分第一(运动保真度超越亚军33%),开源模型中WorldModelBench物理规律遵循排名第一。
三个模型均提供语言优先的接口,通用Qwen模型可将它们作为物理世界工具进行组合。千问团队还透露了内部项目Qwen-RobotClaw——一个机器人智能体框架,使Qwen VLM智能体能够调用套件模型完成开放式任务执行、长程操作与失败恢复、智能体导航与具身问答等复杂场景。
![]()
此图片为IT时代网AI生成的示意图
注:本文中包含AI辅助创作的内容。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.