![]()
![]()
编辑:前沿在线 编辑部
7 月 19 日上午,面壁智能主办的「智在终端 惠及千行」分论坛在世界人工智能大会上圆满举行。
论坛上,面壁智能联合 OpenBMB 正式发布并开源了其首个具身智能技术成果 MiniCPM-Robot 系列模型,「小钢炮」正式进军机器人领域!
本次发布的 MiniCPM-Robot 系列成果包括两个具身智能模型:通用 VLA 模型MiniCPM-RobotManip,与面向移动机器人跟踪导航的MiniCPM-RobotTrack。
MiniCPM-RobotManip 基于面壁智能最新多模态端侧模型 MiniCPM-V 4.6 训练完成,延续了 MiniCPM-V 4.6 「小尺寸、高性能」与视觉 Token 极致压缩的技术优势,以仅 1.5B 的参数规模实现比肩体量更大的3-4B模型的性能、但流式实时推理计算成本减半,模型支持1分钟的具身原生记忆,从而能够高效完成考验上下文记忆的操作任务。
图注:MiniCPM-RobotManip 在真机上完成三明治制作(5倍速)
MiniCPM-RobotTrack 由面壁智能和南京大学合作研发,是业内首个支持真实本地断网部署的跟踪(Tracking)模型,首次实现纯视觉的本地自主指令追踪。
模型原生适配宇树 Go2 Edu ,仅依靠原装摄像头和本地算力即可完成单目标、动态多目标及模糊目标跟踪,稳定达到 5+ Hz,端到端响应时延约 180 毫秒,并构建了自进化数据管线、能够持续提升复杂动态环境下的跟踪能力。
图注:搭载 MiniCPM-RobotTrack 的机器狗可以在开放环境下零样本指令跟随,并且抗各类人物穿梭干扰,同时可以在无网/弱网环境(电梯/停车场)下流畅跟随
目前,MiniCPM-Robot 系列模型均已开源,欢迎开发者与具身智能从业者下载部署并试用:
GitHub 链接:https://github.com/OpenBMB/MiniCPM-Robot
Hugging Face 链接:
https://huggingface.co/openbmb/MiniCPM-RobotManip
https://huggingface.co/openbmb/MiniCPM-RobotTrack
![]()
通用 VLA:MiniCPM-RobotManip
MiniCPM-RobotManip 是一款面向机器人操作的 1.5B 通用 VLA 模型,保留了面壁智能多模态基础模型 MiniCPM-V 4.6 的通用理解能力,并基于多任务进行统一训练,让同一模型学习处理不同指令和操作任务。
根据主流 VLA 基准测试,MiniCPM-RobotManip 的综合性能位列 VLA 模型的第一梯队,与 Qwen-VLA、π0.5 等主流模型的性能相近、甚至有更出色的表现。
![]()
尤其是在考验 VLA 模型上下文记忆的 RMBench 上,MiniCPM-RobotManip 更是明显超越多个主流模型——MiniCPM-RobotManip 得分 53,而主流的π0.5只有10分,接近随机的水平。
如下图,模型可以先盖住不同颜色方块后 ,以红绿蓝顺序揭开,体现其原生上下文能力,当前主流基于单帧反应式的VLA是做不到的。
图注:MiniCPM-RobotManip具有原生记忆能力 (8倍速)
MiniCPM-RobotManip 将 MiniCPM-V 4.6 的视觉 Token 高效压缩优势进一步应用于机器人场景,大幅降低了机器人的视觉输入计算量与推理时延,使机器人在保留1分钟上下文记忆后的推理成本与传统单帧反应式的推理成本相当——换言之,模型性能更优、部署成本却更低。
根据测试,在包含60 帧历史观测的机器人操作任务中,传统重新计算方式每个决策步需要125 TFLOPs,采用流式推理后仅需3.3 TFLOPs,低于 π0.5 在无历史帧输入下的5.0 TFLOPs。
在 H100、BF16 精度下,MiniCPM-RobotManip 单决策步推理时延为120ms,相比 π0.5 的 234ms 降低近一半,实现了上下文记忆与响应效率的兼顾。
![]()
![]()
![]()
首个本地断网部署跟踪模型:MiniCPM-RobotTrack
MiniCPM-RobotTrack 是一款 0.9B 端到端视觉指令跟踪模型,具有以下三个技术优势:
三项跟踪任务领跑开源 SOTA
我们从单目标跟踪(STT)、动态多目标跟踪(DT)和模糊目标跟踪(AT)三类典型场景维度对 MiniCPM-RobotTrack 进行了评测。
在仅有0.9B参数且未进行下游强化学习优化的情况下,MiniCPM-RobotTrack 在三项任务中的追踪率分别达到89.8、73.4 和 80.4,取得开源方案最优结果,相比 OmTrackVLA 分别提升7.0、14.6 和 6.5 个百分点。
在相同的单视角、纯 SFT(监督微调训练)设定下,与其他闭源模型 TrackVLA++ 相比,MiniCPM-RobotTrack 在单目标跟踪和模糊目标跟踪任务上的追踪率分别提升 8.8 和 17.0 个百分点,模糊目标跟踪任务的成功率达到 58.0%。这表明,通过高质量数据和端到端训练,轻量级模型无需依赖多视角输入或下游 RL,也能获得具有竞争力的真实场景指令追踪能力。
![]()
自进化数据管线,让模型在实践中越用越强
针对真机数据采集成本高、长尾场景覆盖有限等问题,MiniCPM-RobotTrack 构建了自进化数据管线,先通过自动检测与人工复核清洗异常轨迹、错误动作等低质量数据,再引入面向具身追踪的 DAgger 策略,让模型在仿真与真机交互中主动暴露薄弱环节,针对快速转向、短时遮挡、多人交叉等复杂场景持续补充高价值样本,在数据闭环中提升跟踪与泛化能力。
真机实测5+Hz,断网也能自主跟踪
经过对宇树 Unitree Go2 完整运行链路的系统性优化,MiniCPM-RobotTrack模型在机器狗原生本地算力下稳定达到5+ Hz,端到端响应时延约180 毫秒。
在真机 Demo 中,即使现场拔掉网卡,机器狗仍能依靠本地视觉画面与文本指令持续完成目标识别、跟踪与运动控制。
该能力可应用于楼宇巡检、人员陪护和园区安防,未来有望拓展至灾害救援、特种作业等弱网、断网或强干扰场景。
本次开源还将提供完整部署流程与一键启动脚本,覆盖模型加载、摄像头接入、文本指令输入和机器人控制接口,真正实现纯本地部署、开箱即用。
![]()
具身智能推理框架:PhyAI
此次发布的两款模型均获得了PhyAI的推理支持。
PhyAI 是一款面向 Physical AI 的开源推理框架,专为端侧极速推理与云端 RL 大规模 Rollout 场景设计。
与模型官方仓库相比,PhyAI 在 NVIDIA GeForce RTX 5090 上运行 π0、π0.5 和 GR00T 时,分别实现了约2.85 倍、1.82 倍和 2.28 倍加速;GR00T 在 NVIDIA Thor 和 A40 上也分别实现约1.40 倍和 4.31 倍加速。
面对 VLA、WAM 等模型结构快速演进、架构差异显著的现状,PhyAI 将易用性与灵活性置于首位,致力于降低模型从研究原型走向高效推理的适配成本。
通过简洁的 API,PhyAI 在发布首日即完成了对 MiniCPMRobot 的适配支持,并使用 CUDA Graph 进行加速,推理帧率从 10.12 Hz 提升至 33.28 Hz,同时还采取了算子融合的方法,使用triton编写了RMSNorm+SiLU gate、conv1d+SiLU+QKV split等为 MiniCPMRobot 定制的融合算子,减少中间变量的搬运次数,将其在 NVIDIA H20 上的推理帧率进一步提升至 36.77 Hz。
![]()
让端侧 AI 走进千行万业
在推进开源技术的同时,我们也在与产业伙伴共同探索真实场景应用。
目前,面壁智能已经与乐聚机器人合作推出展厅导览和园区巡检 Agent 解决方案,并与吉利汽车围绕 VLA 模型、生产仓储应用等方向展开合作,推动具身智能技术在实际环境中持续验证和迭代。
对面壁智能而言,探索物理 AGI 与长期追寻的 AGI 目标一脉相承。
随着机器人逐步进入家庭、办公和工厂,本地感知、推理与决策将成为保障实时性、稳定性和数据隐私的重要方向。
未来,我们将继续投入具身领域,坚持通过开源与产业合作推动模型在真实场景中持续验证,让物理智能更加可靠、安全地走进现实世界。
![]()
前沿动态前沿大会
前沿人物
点「在看」,给前前加鸡腿
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.