![]()
面壁智能连发多个具身智能重磅成果。
作者 | 许丽思
编辑 | 漠影
今年WAIC,一进入展馆,最直接的感受就是,机器人实在太多了!
它们已经不只出现在机器人公司的展台上,连大模型、芯片等各种公司的展区里,也能看到一堆机器人的身影。再往过道里一看,机器狗组队在人群中穿梭,机器马载着人慢悠悠地巡游,那边又来了几个人形机器人忙着耍各种花活。
在现场各种展示背后,也会发现,这次大会,把“机器人能否完成真实任务”这件事摆到更重要的位置,大家都在讨论机器人到底得什么时候才能真正干活。
不过越往真实场景走,具身智能的短板就越清晰。机器人已经拥有越来越灵活的身体,却还缺少一个能够看懂连续画面、记住前序状态,并在弱网环境中及时决策的端侧大脑。
在今年WAIC,国内端侧智能领域公开估值最大的独角兽企业面壁智能,一口气发布并开源多个具身智能重磅成果:通用 VLA 模型MiniCPM-RobotManip、跟踪导航模型MiniCPM-RobotTrack。
同时,现场还发布了由明体科技(MemBodied)联合北京邮电大学、北京大学共同研发的端云一体、全栈优化的具身智能模型的推理框架PhyAI,有效支撑此次面壁具身模型落地。
模型之外,面壁还联合乐聚推出展厅导览和园区巡检解决方案,并与吉利将模型带进生产仓储场景,把技术成果延伸至真实业务流程。
从模型、框架到场景,这样一家国产大模型公司,正在试图补上具身智能端侧大脑的短板,让端侧大模型成为AI连接物理世界的接口。
模型开源的相关链接如下:
GitHub 链接:https://github.com/OpenBMB/MiniCPM-Robot
Hugging Face 链接:
https://huggingface.co/openbmb/MiniCPM-RobotManip
https://huggingface.co/openbmb/MiniCPM-RobotTrack
01.
走进物理世界,机器人为什么
需要一颗运行在端侧的大脑?
以展区导览机器人为例,现场遍布噪声、遮挡与网络盲区,观众随时可能改变路线、提出新问题,机器人要是每次判断都要等待云端返回,原本流畅的导览就变得磕磕绊绊。
进入工厂与园区之类的地方后,这个问题还会被进一步放大。机器人面对移动的人、变化的物体和正在运转的设备,感知与动作之间的延迟,会直接影响任务成败乃至现场安全。
数据同样是一个大问题。机器人在工作的时候,会持续采集人员影像、空间信息和生产数据,频繁上传云端容易增加隐私与合规压力。如果机器人数量大幅扩展,推理费用、通信资源和运维压力等都会持续累积。
这些问题共同指向一个结论:机器人得在本地完成感知、决策和执行闭环,端侧处理是机器人落地更多场景的重要前提。
作为国内端侧大模型头部企业,面壁智能选择切入具身智能赛道,也与之前在基础模型、多模态和端侧部署上的积累有关。
面壁智能的技术路线建立在“能力密度”指标之上,即衡量单位参数量能够承载的模型能力。2024年,面壁智能提出“大模型密度定律”,认为开源大模型的最高能力密度约每3.5个月翻一倍,试图破解端侧AI一直以来面临的效果、成本和速度上难以兼得的难题。
长期的基础模型训练经验,让面壁智能不是选择“以点到面”,而从一开始就坚持“以面到点”,从通用智能出发,让机器人完成更普适、更流水线、更长程的任务。
另外,面壁智能还在多模态模型上有着深厚的技术沉淀,其多模态大模型MiniCPM-V/O系列经历了两年半的积累迭代,开源总下载量突破 2500 万,在海内外技术社区均有广泛影响力。这就让面壁智能具备了处理真实世界流式多模态信息流的丰富经验,能够快速切入具身智能领域。
这些积累,最终汇聚成了面壁智能在WAIC发布并开源的首个具身智能系列模型成果MiniCPM-Robot 。接下来,我们对它进行逐一拆解。
02.
MiniCPM-RobotManip:
实现视觉极致压缩,机器人干活更快了
在演示视频中,机器人制作三明治时,是一个“夹起吐司-放生菜-放火腿-放煎蛋-盖上另一片吐司”的长序列任务。
在这个过程中,机器人一边观察主视角和两个腕部相机的画面,一边还得理解任务并连续生成动作。这项表面看似简单的任务,实际上要求VLA模型每秒完成数次推理。
这种连续画面会产生大量视觉Token,计算量会随着历史观测不断增加。所以,受限于推理成本,大多数VLA模型只能根据眼前的观测决定下一步动作,没法把历史观测和已经执行过的步骤完整纳入判断。
举一个简单的例子,让机器人按按钮5次。如果它没有前序的视觉记忆,它要么就是按一下停了,要么就是不停按,缺少上下文记忆会影响机器人做事的完整性。模型得看到此前的动作,才知道任务进展到了哪里,并在第五次及时收手。
面壁智能的解法,是把MiniCPM-V 4.6积累的视觉Token压缩能力迁移到MiniCPM-RobotManip中,用更少的Token表示连续画面。据了解,其整体计算量减少一半,推理速度还提高了;在保留上下文记忆时,其通过流式计算方法实现推理成本和传统单帧反应式一样。
![]()
![]()
所以你能看到,机器人在做三明治的时候,连续任务不会中途“断片”了,反应更快、动作更丝滑,但计算量其实还减半了。
MiniCPM-RobotManip将参数规模控制在1.5B,实现了小尺寸、高性能,这也体现了机器人模型对效率的特殊要求:只有 4B量级模型的单词推理速度能达到200ms ,保证机器人操作不卡顿;而继续扩大VLA参数能带来多少实际收益,目前仍缺少充分验证。
从榜单成绩看,MiniCPM-RobotManip在传统评测中进入第一梯队,整体表现与Qwen-VLA、π0.5等模型相近;在仿真评测场景中进行通用多任务统一训练后,部分指标达到专家模型水平;在RMBench这类考验上下文记忆任务的榜单中,其得分达到53,π0.5为10分,接近随机的水平。
![]()
03.
MiniCPM-RobotTrack:
拔掉网卡,机器人依旧能自主跟随指定人员
在下面的演示中,可以看到,在拔掉宇树Go2机器狗身上的网卡后,它依然能够根据自然语言指令识别指定人员并持续跟随,面对疾驰而过的电动车、走过的路人,它能够及时躲避;进入电梯、地下停车场等弱网环境,它也依旧能够稳定跟踪。
![]()
![]()
![]()
这背后,靠的就是MiniCPM-RobotTrack。
MiniCPM-RobotTrack以MiniCPM4-0.5B基础,整体参数规模为0.9B。该模型统一建模视觉观测、自然语言指令与机器人控制决策,直接将一句文本指令转化为运动行为。机器狗只需使用原装摄像头和本地算力,无需外接开发板或额外安装独立感知模块。
为检验模型能否应对真实追踪中的复杂变化,团队围绕多个场景进行测试:持续跟踪单一目标、在多个动态目标同时运动时准确识别并跟踪目标,以及根据模糊指令、相似目标或目标信息不完整的情况下,理解指令意图并持续跟踪。
在没有进行下游强化学习优化的情况下,该模型在这三项任务上的追踪率分别达到89.81%、73.38%和80.35%,取得开源方案中的最优结果,较OpenTrackVLA提升7.04、14.58和6.46个百分点。
![]()
轻量化的模型能取得这样的成绩,关键就在于数据端,团队搭建了一套高质量数据驱动的自进化数据管线,让模型在高质量交互中持续成长。
团队先清洗仿真器产生的异常轨迹、错误动作和无效交互,再通过面向具身追踪的DAgger策略,让模型在仿真和真机环境中持续暴露自己的弱点。快速转向、短时遮挡、多人交叉等复杂情况被重新收集并送回训练,数据由此围绕模型最容易犯错的地方不断补强。
该模型还能一键轻松部署,团队围绕宇树Unitree Go2的完整运行链路进行了系统级优化,模型在宇树Go2上的原生算力即可稳定达到5 FPS以上、约180毫秒时延。
此次开源也覆盖了环境安装、模型加载、摄像头接入、文本指令和机器人控制接口,并提供一键启动脚本,快速让机器狗从开箱到拥有纯视觉、纯本地的自然语言指令跟踪能力。
这样的话,机器狗只凭原装摄像头和本地模型,就可以在断网状态下理解指令并持续跟踪目标,降低延迟和隐私风险,也为楼宇巡检、人员陪护、园区安防及灾害救援等弱网场景打开了落地空间。
MiniCPM-RobotManip、MiniCPM-RobotTrack这两款模型分别解决了操作和移动的问题,而具身智能模型的推理框架PhyAI则有效支撑具身模型的落地。
PhyAI在RTX 5090上运行π0、π0.5和GR00T时,分别实现约2.85倍、1.82倍和2.28倍加速;GR00T在NVIDIA Thor和A40上的加速倍数分别约为1.40和4.31。
适配MiniCPM-Robot后,PhyAI使用CUDA Graph将推理帧率从10.12Hz提高到33.28Hz,又通过定制融合算子减少中间变量搬运,在H20上的推理帧率进一步达到36.77Hz。模型、推理和部署由此形成了一条更完整的链路。
04.
进展厅、园区和工厂,
端侧具身智能开始接受场景检验
技术跑通之后,下一步就是把机器人送进真实场景。
面壁与乐聚选择从展厅导览、园区巡检这类场景切入,背后有着现实考量,这些地方人流密集、噪声复杂且网络质量不稳定,必须要靠端侧模型来兜底。
在双方发布的展厅导览Agent解决方案中,面壁端侧多模态大模型与乐聚夸父机器人本体及导航系统相结合,使机器人在断网或弱网状态下仍可调用本地知识库完成讲解、问答、路线规划和避障。
园区巡检比展厅导览更接近刚需型应用,在双方联合发布的园区巡检 Agent 解决⽅案中,面壁的多模态模型和CV模型搭载于乐聚机器人及巡检系统后,可以识别违停、路面和公共设施等异常情况,并在本地处理敏感画面。
这些方案之前已经在真实场景中落地验证了,本次联合方案的推出,相当于将过去的项目经验进一步沉淀为可复制的产品能力。
![]()
面壁与吉利的合作则进一深入生产仓储场景,双方一方面在模型层共同训练和发布了 VLA 模型, 保持其通用多模态理解能力同时,融入与真实世界交互能力,并在仿真评测场景上采用通用多任务统一训练,在指标上达到专家模型水平。
另一方面,双方也通过具身智能体框架RoboHarness,整合VLM、VLA、机器人本体和导航系统,推动吉利机器人完成包含多个步骤的仓储长程任务。
从展厅讲解到园区值守,再到生产仓储,端侧部署的意义已经超出响应速度。机器人摆脱了对稳定网络和云端接口的持续依赖,才有机会成为可以常态化值守的服务设备、不间断作业的产线工人。
05.
结语:端侧大模型,正在重塑具身智能落地
据弗若斯特沙利文预测,全球端侧AI市场规模将从2025年的3219亿美元,以年均40%的复合增长率扩张,到2029年突破1.22万亿美元;谁能在窗口期抢下最多的落地场景,谁就占据先机。
具身智能行业正在从演示走向部署,面壁智能想抢占的,就是这场变革中关键的端侧基础设施位置。
端侧大模型,让AI获得了一条通往物理世界的路径,也让机器人能够从理解世界到深度且稳定参与世界,这是具身智能落地的起点。越来越多机器人能够摆脱对云端的持续依赖,在真实现场日复一日地把事情做完,端侧智能才真正完成从技术路线到产业基础设施的跃迁。
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.