对机器人「动手动脚」
今天,7月19日,面壁智能在 WAIC 期间发布并开源了首个具身智能系列模型成果,MiniCPM-Robot,包含两个部分
第一个模型管手:MiniCPM-RobotManip,通用 VLA 模型,1.5B,机器人看着画面听着指令,输出动作,本地部署
↓ MiniCPM-RobotManip 在真机上完成三明治制作(5倍速)
第二个模型管腿:MiniCPM-RobotTrack,这个是和南京大学合作的项目,跟踪导航模型,0.9B,原生适配宇树 Go2 Edu,纯本地部署
↓搭载 MiniCPM-RobotTrack 的机器狗可以在开放环境下零样本指令跟随
简而言之:面壁对着「机器人model」,动手动脚
当然了,同一时间发布的,还有个推理框架 PhyAI,是明体科技联合北邮、北大研发,端云一体,全栈优化,为这次面壁具身模型的落地,做底层支撑
![]()
面壁这家公司,一直的绝活就是把大模型往小里做、往设备上搬,其小钢炮 MiniCPM 在开源社区出名声在外,而多模态的 MiniCPM-V/O 在练习迭代,时长高达两年半之后,总下载量过了 2500 万
今年具身赛道也是大火,而面壁的这些积累和经验也派上了大用场,具身智能眼下的卡点,恰好全对着端侧的老本行:本地部署、上下文管理、推理优化
![]()
面壁智能学术合伙人、多模态智能首席科学家姚远
先说记性
模型也好、机器人也罢,其实是没有时序记忆的,也不是真的会数数(在不调用工具的前提下),之前不还有一个问题么:9.11 和 9.9 谁大?
如果放在具身环境里,如果不进行专门的记忆优化,百分百爆炸。比如让现有的机器人去按某个按钮 5 次,对于大多数的机器人,要么按 1 次就停,要么按个不停...虽然很离谱,但这是真的
![]()
如果需要让机器人按 5 次就刚好收手,就需要把机器人【视觉、语言、动作】这三个信息进行长程任务优化。这里补充一个信息,经常你会在具身智能的有关介绍里看到「VLA 模型」,其实就分别对应了:V-视觉、L-语言、A-动作
至于原因,是架构里没给记忆留位置
![]()
但为什么不留呢?算不动
机器人不同于大模型,需要本地高频进行计算,否则就会状况频出。在这种场景下,机器人每秒推理好几次,每次进三张图,两个腕部相机加一个主视角。倘若真把历史画面全带上,token 就直接炸了
而对于 token 的高效使用,恰好是端侧多模态的基本功,MiniCPM-V 一代一代练的就是这个。MiniCPM-RobotManip 是基于 5 月发布的 MiniCPM-V 4.6 训练,那个模型两个月下载破 200 万,视觉 token 压缩做到了极致,并在具身场景下,实现了记忆
MiniCPM-RobotManip 具有原生记忆能力 (8倍速)
作为另一个结果:面壁的模型,即便是带上历史观测数据,进行流式推理,计算量跟单帧反应式一个成本
![]()
![]()
对于 VLA 的上下文记忆,其实也是有专门的 Benchmark 的,比如RMBench(人民币 Bench?),全名 Robot Memory Benchmark。 主流模型在这个榜上的成绩,基本没比乱猜好多少...接近随机
而面壁的模型由于进行了记忆优化,在这一领域有了显著的优势:RMBench 拿到 53 分的水平。当然其他的传统榜单也站在第一梯队,这里就不具体说了
![]()
这背后其实也有面壁家底的作用,对于多数 VLA 团队,会从眼下出发,先扎进一个场景把专项做精,再从点铺到面。在这一方面来说,作为模型训练团队,面壁起手就是是通用智能,把多任务进行统一训练,综合的编码效率自然会更高
本地部署
先看个视频吧,翻车现场
这也是具身智能落地的老现象:demo 很惊艳,机器人很落地(字面含义)
机器人在脱离了管控、网络信号之后,很多事情经常无法预测,典型的就是电梯和地下停车场。家庭和工厂还多一层顾虑,画面往云上传,隐私和合规都难以解决。机器人终归要进人类社会,跟人朝夕相处,VLA 早晚得跑在终端上
![]()
至于端侧,这对于面壁来说就是肌肉记忆了,而 MiniCPM-RobotTrack 就是按这个标准做的:底座是自家 MiniCPM4,原装摄像头加机载算力,一键脚本部署
做出来的成品,更是业内首个真实本地纯无网部署的 tracking 模型,机器狗原生算力上稳定 5+ FPS,端到端时延约 180 毫秒
![]()
即便是纯本地,性能也未打折,比如看下面的这个榜单跟踪能力按三种真实场景考,单目标跟踪、多人干扰、模糊指令,三项追踪率 89.8、73.4、80.4,开源方案里全是最优,对比开源的 OpenTrackVLA,分别高出 7.0、14.6、6.5 个百分点
对比名单里还有个闭源的 TrackVLA++。放在相同的单视角、纯 SFT 设定下比,RobotTrack 在单目标和模糊指令两项,分别领先 8.8 和 17.0 个百分点,模糊指令的成功率做到 58.0%
这背后是怎么做到的呢?更好的数据
为此,面壁团队搭了条自进化管线,用的是 DAgger 闭环:模型先在大规模通用数据上学个底子,再扔进仿真和真机里持续交互,把自己的短板暴露出来,横穿镜头、快速转向、短时遮挡。系统盯着薄弱场景定向采集,专家策略补上高质量数据,回炉再训
![]()
再往远处想一步,这套无网跟踪能去的地方不少。地震火灾这种通信瘫痪的现场,跟着救援人员钻废墟,这些都是在脱网环境...想必之后,「断网测试」也会成为具身大脑出场测试的标准
推理速度
大模型卡一卡其实无所谓的,没啥大的影响(除了让你不爽外)
但机器人是要真实进入生活的,是不能卡的...你就想吧,机器人这玩意儿,如果给你拉拉链,稍微延迟这么半秒,然后咔嚓一下,对吧...所以通常来说,机器人操作有条红线:响应时间不能过长,不然就是个寄
![]()
那么我们倒推一层,如果我们要压低响应时间,就需要分别在【算力、参数和推理】这三个方面分别下功夫
算力这块,目前也不是你我能决定的,就不在讨论了
参数这块,在当前版本中,其实也是被锁住的,而对于 VLA 的参数规模,行业普遍跟着先驱 π 系列走,3B 上下,再大的话,在机器人这块的体验并没有明显变化
至于推理,就是在终端上,把每一寸算力都抠出来,而这个,恰好又是端侧公司的看家本领
干这个活的,是开头提到的推理框架 PhyAI,在发布首日就完成了对 MiniCPM-Robot 的适配:
先用 CUDA Graph 加速,推理帧率从 10.12 Hz 提到 33.28 Hz;
再用 triton 写了一批定制融合算子,减少中间变量的搬运,在 H20 上进一步干到 36.77 Hz
并且这事儿吧,是能让整个行业受益:比如在 RTX 5090 上跑 π0、π0.5、GR00T,分别加速 2.85、1.82、2.28 倍
落地使用
让我们把视角,从模型挪到落地,目前公开的有两条线
先是乐聚。面壁联合乐聚机器人发了两套方案:展厅导览&园区巡检
展厅导览:无网状态下纯端侧运行,本地知识库离线讲解,自由问答,顺带实时理解展厅环境,规划路线避障
园区巡检:盯违停车辆、路面异常、公共设施异常,敏感画面就地分析,数据主权归客户
![]()
你会发现,这些个场景里主要考验的就是端侧能力,毕竟展馆和园区的那种信号信号啊,你懂的
第二条线是工业,代表的就是是吉利,两边从模型层开始合作,两边联合训练 VLA,再用 RoboHarness 框架把多模态大模型、VLA、导航系统串成整体,在仓储场景跑长程任务,内置数据闭环,来回训练
![]()
最后
这事儿说到底就一句:面壁做具身智能了,带着端侧攒下的全部家底进的场
做 AGI 的公司,终归要从语言走进物理世界。对同行来说,面壁这条路径也算个参照:机器人的卡点,未必都得在自动化的技术里找答案
还有就是...面壁目前也在招人,尤其是具身智能方向的,感兴趣的可以访问这里,招聘直达:
面壁内推
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.