IT时代网8月13日消息,具身智能公司 Dyna Robotics 发布机器人基础模型 DYNA-2,基于超过 100 万小时的第一人称人类视频训练,任务成功率最高可达 90%。
官方将 DYNA-2 描述为"世界动作模型",目标是通过观察人类活动,学习动作如何改变物理世界。其预训练完全依赖人类视频数据,规模超过 100 万小时第一人称视频,相当于约 170 年的人类经验。公司联合创始人表示,通用机器人长期受限于数据瓶颈,人工采集物理遥操作数据难以扩展到通用智能,而该模型通过观察人类活动来学习动作如何改变物理世界。
DYNA-2 在采取动作前先预测物理世界如何运动,为机器人补足了传统视觉语言模型缺少的空间推理与接触物理能力。模型通过预测下一帧画面内容与应采取的动作两项训练目标,获取空间关系、运动方式以及物体受接触后的响应等信息。
随着预训练数据增加,机器人在 15 项基准任务中的表现持续提升,公司称之为"人到机器人的缩放规律"。在一项实验中,13 分钟机器人专用数据就让两只五指机械手学会拧开瓶盖;制造任务里,在后续训练数据集不变的情况下,成功率随预训练规模扩大从约 20% 提升至 80% 到 90%。据公布,一次客户部署中质量通过率达 87%,上一代为 46%;在依指令执行不同动作的任务中,视频协同训练让得分提升 133%。
![]()
注:本文综合自IT之家等,文中包含AI辅助创作的内容。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.