网易首页 > 网易号 > 正文 申请入驻

刘知远押注具身智能,面壁想做的不止VLA

0
分享至



作者|齐马

编辑|星奈

媒体|AI大模型工场



“如果目标是登月,仅仅不断爬树,并不能真正到达月球。”刘知远说。

在具身智能成为显学的当下,这句话多少显得有些不合时宜。

过去一年,机器人学会了跑步、跳舞、叠衣服、打乒乓球,也开始进入工厂,尝试分拣、搬运和装配。在今年的世界人工智能大会上,能完成什么动作、进入多少场景、距离量产还有多远,几乎成为所有机器人公司证明自身进展的共同方式。

但在面壁智能联合创始人、首席科学家刘知远看来,一段完成度很高的Demo,并不必然意味着机器人正在走向通用智能。

“现在很多叠衣服、打乒乓球等具身系统,仍沿用2018年以前的专用智能路线:直接学习某一种能力。”刘知远说,“未来三到五年,具身智能也一定会走向‘先通后专’。人类也是先形成对世界的常识,再去学习开车、做饭或叠衣服,而不是只靠成千上万条单项任务数据。”

这也是面壁智能进入具身智能时,试图与行业拉开的第一重差异:不从某一个专用Skill出发,逐步拼出一台看起来无所不能的机器人,而是先寻找具身智能的通用基础能力,再让通用模型进入具体场景。

7月19日,面壁智能发布并开源了首个具身智能系列成果MiniCPM-Robot,包括面向机器人操作的通用VLA模型MiniCPM-RobotManip、面向四足机器人的跟踪导航模型MiniCPM-RobotTrack,以及具身智能推理框架PhyAI。

两款模型的参数量都不大,却在多项基准上取得了接近或达到同类模型最佳的成绩。





成绩背后,仍是面壁熟悉的小模型路线。

产品形态发生了变化,面壁讲述的故事却没有完全改变。

过去几年,面壁一直试图用更高的模型密度和更低的计算成本,把语言、多模态模型装进手机、汽车和摄像头等终端。如今,它开始把同一条路线延伸到机器人。

在刘知远的设想中,语言模型提供思考、决策和规划,多模态模型负责感知,具身智能则补上动作与行动能力,三者最终形成“感知—思考—行动”的完整闭环。

具身智能不是面壁突然增加的一条业务线,而是端侧智能进入物理世界后的自然延伸。MiniCPM-Robot想验证的,也不只是机器人能否完成一次三明治制作,而是一条在语言模型中得到证明的“先通后专”路线,能否在机器人身上重演。

不为一段Demo反复“爬树”

具身智能眼下最容易被看见的是动作,也是最容易制造误解的部分。

外界看到机器人完成了任务,却很难判断它究竟理解了任务,还是记住了一套经过反复训练的动作。

“目前大家主要通过Demo和案例了解具身智能的能力,但Demo并不完全代表行业的真实进展。”面壁智能多模态首席科学家姚远直言,“为了展示好某个场景,团队可以针对特定任务采集上千条数据,专门训练一个专家模型;在没有实际硬件供公众测试的情况下,做出一段效果不错的Demo并不难。”



真正困难的是,当桌子换了、物体变了,或者指令增加了一步,机器人还能不能继续完成任务。

按照姚远的观察,当前不少所谓的“通用模型”,仍然需要针对不同任务分别微调。为了评测十个Benchmark,可能需要训练十套模型;一旦场景发生变化,能力就会明显下降。

姚远认为,行业正在逐渐形成一个共识:让同一套模型参数完成更多任务,走向Generalist。一个足够好的通用模型,也应该能够吸收不同来源的数据,而不是让不同能力相互冲突。

MiniCPM-RobotManip正是这一思路的初步验证。它只有1.5B参数,没有围绕某一个动作进行深度定制,而是尝试把多种任务统一训练到同一套参数中,在保留语言和视觉理解能力的同时,学习与真实世界交互。

面壁希望复制大语言模型“先通后专”的发展路径。

其底层逻辑是,模型先掌握关于世界的通用知识,再被培养成某个领域的专家,专业能力的上限才会更高。

在他看来,今天真正产生商业价值的Coding模型,并不是只用代码训练出来的。它首先是一个掌握了通用语言、知识和推理能力的基础模型,随后才成为专业程序员。具身智能也应该先成为“大学生”,再学习做饭、巡检和分拣,而不是一开始就被锁定为某条流水线上的熟练工。

这条路线短期内不一定最容易展示效果。单项任务可以通过大量专用数据快速优化,而通用能力的提升更慢,也更难仅凭一段视频证明。

面壁也没有断言自己已经找到终局。姚远将今天的具身智能类比为2018年前后的预训练模型:当时BERT、GPT和T5等路线并存,行业还不知道谁会胜出。

姚远也提醒,具身智能的技术路线尚未收敛,“当前最火的不一定是能笑到最后的”。

MiniCPM-Robot因此更像一次路线验证:面壁要证明的不是自己能否再做出一个机器人Demo,而是小尺寸基础模型能否获得跨任务、可扩展的行动能力。

机器人要有记忆,先要压缩视觉Token

要从专用动作走向通用能力,机器人首先要解决一个基础问题:记住过去。

目前许多VLA模型仍采用接近“单帧反应”的方式,根据当前画面和指令预测下一步动作。如果任务是拿起桌上的食材,当前画面可能已经包含全部答案;但当指令变成“点击第二个按钮5次”,机器人必须知道此前已经按过几次,才能决定何时停止。

“原生上下文记忆,对我们来说是一个自然应该具备的能力,但此前很多具身模型并没有将它纳入设计。”姚远解释,当前许多VLA模型只能根据当前画面决定动作,缺少对历史状态的记忆。

MiniCPM-RobotManip因此把上下文记忆作为关键能力之一,可以保留约一分钟的视觉历史。但一分钟连续画面放到机器人身上,会迅速变成数百张图片和数万乃至十万个视觉Token。

机械臂通常同时接收主视角和腕部摄像头的多路画面。如果模型每执行一步,都重新计算此前的全部视觉信息,就很难保持实时响应,更难部署到端侧设备。

要在端侧处理如此长的视觉历史,模型既需要极致的视觉Token压缩,也要解决流式上下文管理和训练问题。

这恰好是面壁从多模态模型切入具身智能的技术支点。高清图片和长视频一直是多模态模型的计算瓶颈,同一画面需要被转换成多少Token,不仅决定推理成本,也决定模型能在上下文中同时容纳多少帧信息。

据姚远介绍,相比市面上绝大多数模型4倍的视觉压缩率,面壁在无损情况下做到了16倍,还可以通过视觉编码器内部融合进一步降低计算量。

面壁希望用更少的Token表示每一帧画面,再通过流式计算保留历史,使机器人拥有记忆的同时,不让推理成本随着上下文长度同步增长。





小模型也不只是成本选择,而是机器人能否实时工作的前提。模型如果等待一两秒才能预测下一步动作,机器人会出现明显卡顿;在目标跟踪等动态场景中,过高延迟甚至意味着结果已经过时。

这也是刘知远反复强调模型密度的原因。在端侧,参数更多并不天然意味着技术含量更高;在尺寸、功耗和响应时间的限制下保持能力,反而更具挑战。

MiniCPM-RobotTrack体现了这条路线的另一面。它被部署在宇树Go2 Edu上,不依赖云端API,只通过机器狗的摄像头和本地算力,完成自然语言指令理解、目标识别和持续跟踪。即使拔掉网卡,也能在电梯、停车场等无网或弱网环境中运行。

但具身模型的技术难题不只有计算效率,还有数据。

姚远认为,具身智能无法像语言模型一样快速发展的重要原因,是缺少可以直接利用的海量互联网语料。

互联网视频规模最大,却缺少精确的机器人动作信息;仿真数据容易生成,但与真实世界存在差距;真机数据精度最高,成本也最高。面壁同时使用开源、采购、仿真和自主采集数据,并让模型在真实交互中暴露长尾问题,再补充下一轮训练数据。

“没有一种数据是完美的,要么就是量不够,要么就是精度不够。”姚远如此概括当前的数据困境。

Token压缩解决“算不算得动”,上下文记忆解决“记不记得住”,数据闭环则决定模型能不能持续进化。这三者共同构成面壁从多模态模型走向物理世界的技术基础。

不造机器人,只做“通用大脑”



进入具身智能后,面壁没有把自己定义为一家机器人公司。

它不生产本体,也不准备围绕某一种机器人建立封闭的软硬件体系,而是希望把模型部署到机器狗、机械臂、人形机器人、汽车和其他端侧设备中。

刘知远用“大脑”和“小脑”解释面壁与本体厂商的边界。

“像宇树这样的企业,他做本体做得很好,在这个基础上,我感觉他们更适合做这个本体上的小脑。”刘知远解释,“我们说的具身模型,还是发挥大脑的角色。”

小脑负责控制身体,大脑负责理解指令、形成规划、管理记忆和迁移任务。未来面壁与本体厂商的合作,也将更多建立在“大小脑协同”之上。

这是一种与垂直一体化不同的产品思路。有人希望像苹果一样,把模型、系统和本体全部掌握在自己手中;面壁现阶段更倾向于生态打法。

在刘知远看来,企业的禀赋与基因决定了它不可能把每个环节都做好。相比模型、本体和硬件全部自己完成,聚焦模型、与其他厂商合作,是面壁胜算更大的选择。

当记者追问面壁是否会自己下场做本体时,他回答得更加直接:“如果既做模型也做本体,我们一定不如只把模型做好能够取得的胜算更大。”

因此,MiniCPM-Robot并不是一款直接面向普通消费者的机器人产品,而是面壁向产业链交出的一组底层模块:通用VLA提供“大脑”,MiniCPM-RobotTrack验证纯本地执行,PhyAI降低模型进入不同硬件的推理与部署成本。

开源则是面壁扩大本体覆盖范围的方式。

开源是这套生态打法的重要支点。具身智能拥有大量不同本体,需要完成各种适配,仅靠一家公司很难推动。面壁希望借助开源模型和推理框架,让开发者与本体厂商共同补全生态。

面壁希望通过模型、框架和合作进入更多机器人,而不是自己制造一台机器人包办所有环节。它要争取的,是下一代终端生态中“通用大脑”的位置。

商业化尚早,时间也是朋友

对于具身智能当前的商业阶段,面壁的态度相对克制。

“具身智能目前还没有到大规模商业化的阶段。”姚远表示,在技术跨越质变点之前,更重要的是推动技术本身增长;基础能力突破后,更多应用场景才可能自然出现。



面壁并非拒绝商业化。它已经与吉利等伙伴探索实际场景,也需要通过项目积累工程能力和合作关系。但现阶段,它不愿为了短期订单,把主要研发资源锁定在某一个专用Skill上。

刘知远将具身智能放在更大的端侧商业版图中理解:语言模型最成熟,多模态感知其次,具身行动仍处于早期。不同能力会按照成熟度逐次进入应用,而不是同时迎来商业爆发。

刘知远把面壁的落地节奏概括为:先语言模型,再多模态感知,最后进入行动。只有技术逐步成熟,相应的商业化才可能展开。

面壁押注的是两个趋势:模型密度持续提高,同等能力所需的参数和计算量继续下降;与此同时,端侧芯片为Transformer和多模态模型进行原生优化,终端算力继续增长。当两者交汇,端侧模型才可能从有限的专用任务走向通用能力。

这仍需要时间。

“跑得早、跑得快都不重要,重要的是你跑得准。”刘知远强调,能否判断对未来的发展方向,才是这场竞争的关键。

结语

从MiniCPM-RobotManip完成一次三明治制作,到机器狗在断网状态下跟随指定目标,面壁已经让MiniCPM从理解屏幕中的文字和图像,迈出了作用于物理世界的第一步。

但按照面壁自己的标准,这些Demo还不能证明它抵达了“月球”。

它们更像是几次路线验证:上下文记忆能否让机器人摆脱单帧反应,视觉Token压缩能否让连续感知进入有限算力,通用基础模型又能否跨过任务和本体之间的边界。

如果“先通后专”能够在机器人上复制语言模型的演进,面壁获得的将不只是某一个场景的解决方案,而是一颗可以进入不同本体的通用大脑;但如果具身智能长期依赖高度专用的数据和模型,这条路线也将承受更大的时间成本。

MiniCPM-Robot当然还不是一枚已经升空的火箭。

但至少,面壁开始拒绝用一棵树的高度,衡量自己与月球之间的距离。

数据支持天眼查,大模型独家合作账号

声明:个人原创,仅供参考

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
梅总回应误伤中网观众:盼能当面道歉!我绝非故意 只想阻止球出界

梅总回应误伤中网观众:盼能当面道歉!我绝非故意 只想阻止球出界

我爱英超
2026-10-05 23:47:49
央视曝光后,湖南、湖北、云南等地开展核查处置

央视曝光后,湖南、湖北、云南等地开展核查处置

政知新媒体
2026-10-04 19:48:01
“既然已经死了,就安排人把他们给埋掉了”缅北明家犯罪集团杀害中国人细节获披露

“既然已经死了,就安排人把他们给埋掉了”缅北明家犯罪集团杀害中国人细节获披露

界面新闻
2026-10-05 21:39:39
不愿回马杜罗时代!委内瑞拉不崩反涨,中国先吃到石油外红利

不愿回马杜罗时代!委内瑞拉不崩反涨,中国先吃到石油外红利

共工之锚
2026-10-05 00:53:10
突发!对伊朗,特朗普改变承诺!

突发!对伊朗,特朗普改变承诺!

财经要参
2026-10-05 20:30:05
为啥工程圈说WPS会员要挨个查?网友:冤枉不了一个人

为啥工程圈说WPS会员要挨个查?网友:冤枉不了一个人

另子维爱读史
2026-10-05 19:47:34
“缅方一直通报说,没有中国人死”,为了取证,民警冒着果敢战火深入缅北电诈园区,在埋尸点找到三具高度腐败的尸体并带回国内

“缅方一直通报说,没有中国人死”,为了取证,民警冒着果敢战火深入缅北电诈园区,在埋尸点找到三具高度腐败的尸体并带回国内

都市快报橙柿互动
2026-10-05 16:51:52
63岁刘欢病逝,戳穿最残酷的医疗真相:治病的金钱上限,只有100万…

63岁刘欢病逝,戳穿最残酷的医疗真相:治病的金钱上限,只有100万…

犀利强哥
2026-10-05 06:58:57
深圳APEC开幕在即,高市称谓被撤!中方拒认“首相级”外交名分

深圳APEC开幕在即,高市称谓被撤!中方拒认“首相级”外交名分

无情有思可
2026-10-05 16:13:32
刚刚,全部停打胰岛素!美国新疗法让12名糖人重获新生

刚刚,全部停打胰岛素!美国新疗法让12名糖人重获新生

徐德文科学频道
2026-10-05 19:39:08
梅总误伤观众判负后续:扣除20万美元200积分 德约相信他并非故意

梅总误伤观众判负后续:扣除20万美元200积分 德约相信他并非故意

醉卧浮生
2026-10-05 19:31:46
华人科学家张锋祝贺导师获诺奖,表示有幸曾师从三位新晋诺奖得主

华人科学家张锋祝贺导师获诺奖,表示有幸曾师从三位新晋诺奖得主

现代快报
2026-10-05 22:34:18
新娘婚礼前两天被马蜂蜇伤,嘴唇肿胀自嘲“像蛤蟆精”,当事人:连夜就医,婚礼如期举行

新娘婚礼前两天被马蜂蜇伤,嘴唇肿胀自嘲“像蛤蟆精”,当事人:连夜就医,婚礼如期举行

极目新闻
2026-10-05 14:00:13
无缘中网16强!孙心然0-2输高芙 被裁判影响心态连丢六局落泪

无缘中网16强!孙心然0-2输高芙 被裁判影响心态连丢六局落泪

醉卧浮生
2026-10-05 23:43:25
上海,男子在KTV饮酒后猝死,家人向同饮者和KTV索赔58万元

上海,男子在KTV饮酒后猝死,家人向同饮者和KTV索赔58万元

欢姐说法
2026-10-05 09:45:04
婚变传闻迎来大结局,吴奇隆正式官宣息影,和刘诗诗走上了两条路

婚变传闻迎来大结局,吴奇隆正式官宣息影,和刘诗诗走上了两条路

少女的烦恼
2026-10-05 19:07:15
时隔两年进中网16强!郑钦文2-1力克18号种子 首盘抢七险胜

时隔两年进中网16强!郑钦文2-1力克18号种子 首盘抢七险胜

醉卧浮生
2026-10-05 17:10:17
蔡康永怂了!最新回应还想当双面人网友不买账,更多品牌出面切割

蔡康永怂了!最新回应还想当双面人网友不买账,更多品牌出面切割

萌神木木
2026-10-05 16:31:00
古天乐、此沙、任达华主演电影《侦战》宣布撤档,上映5天票房仅443万元,后续将择期重启公映

古天乐、此沙、任达华主演电影《侦战》宣布撤档,上映5天票房仅443万元,后续将择期重启公映

环球网资讯
2026-10-05 14:19:18
网传东航空姐下跪事件乘客为上市公司董事长? 万年青回应

网传东航空姐下跪事件乘客为上市公司董事长? 万年青回应

凤凰网财经
2026-10-05 21:13:08
2026-10-06 02:08:49
AI大模型工场 incentive-icons
AI大模型工场
专注AI大模型行业媒体,深度解读公司大模型行业动态,且提供一手的AIGC,行业大模型内容。
403文章数 90关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

孙颖莎整顿乒乓球观赛礼仪:有闪光灯、呐喊等干扰

头条要闻

孙颖莎整顿乒乓球观赛礼仪:有闪光灯、呐喊等干扰

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

本地
亲子
健康
时尚
公开课

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

亲子要闻

原生家庭缺爱的人,很容易成为巨婴

刷酸祛痘,为什么有人翻车?

秋天外套不用买太多,这三件基础款一定要准备好,简约又不挑年纪

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版