一个模型,能控制机器人、开车、打游戏、还能飞无人机。这听起来像是把四个不相干的活儿塞进同一个大脑里。
它靠什么干活
![]()
逻辑其实很直接:模型先从真实世界里拿到视觉观察,再基于这些观察做出动作。没有为机器人单独写一套规则,也没有为开车单独训一个模型,视觉输入是它理解世界的统一入口。
换句话说,机器人看到的、汽车看到的、游戏画面里呈现的,在它这里被当成同一类东西处理——都是画面,都要从画面里读出下一步该做什么。
为什么这件事值得多看一眼
过去这类任务通常是各做各的:机器人一套系统,自动驾驶一套系统,游戏AI又是另一套。每换一个场景,就得重新搭一遍。
现在把视觉观察作为共同起点,一个模型覆盖四种完全不同的载体,至少说明这条路是走得通的。至于它在这四件事上分别做到什么水平,目前还没有更多细节。
能同时开机器人、开车、打游戏、飞无人机,本身就是个不小的跨度。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.