![]()
现在的具身智能正处在面临毕业,还没正式进入社会的节点上。
作者 | 李威(北京)
2026年的机器人不再满足于跳舞、格斗和翻跟头这样的「炫技」,而是开始着力展示进入真实场景的可能性——泡茶、做饭、按摩、分拣货物、参与生产制造。除了各家用于场景展示的机器人,擎天租还在世界人工智能大会的场馆中部署了60余台不同型号的机器人,来承担公共服务。
很明显,以前行业对机器人关注点是走得稳不稳,抓取是不是牢固,现在则更关注机器人能不能在真实场景中持续稳定地工作。人们开始关心,机器人在真实场景中工作的耐久性;对复杂场景的适用性——能否把能力迁移到新的对象、环境和本体;以及落地应用的经济账——在产线上应用机器人,能否算清投入产出比。
这种转变背后的一个核心逻辑是,行业要通过量产和落地能力,来证明具身智能的实际价值。
具身智能厂商们已经开始讲规模化量产的故事。智元3月下线交付了第10000台机器人,6月就已经达到15000台;宇树预计2026年机器人出货量至少较2025年翻倍,最高可能接近三倍,并计划将年产能最高扩至3万台。这些产能最终需要有人买单,变成销售数字。
量产在加速,机器人需要尽快具备服务真实场景的能力。这要求围绕模型、本体、数据和场景建立一个能够自行运转的循环:模型解锁任务,本体承载能力,场景提供工作机会,真实工作又产生新的数据,推动模型和本体继续进化,让数据飞轮和经济飞轮同时转起来。
量产检验的是制造和供应链能力,落地检验的则是真实作业能力、系统稳定性和商业价值。这个过程就像学校集中培训基础学习能力,然后将毕业生批量输出为生产生活场景的劳动者。现在的具身智能正处在面临毕业,还没正式进入社会、走向工作岗位的节点上。
![]()
具身智能不会一下「毕业」
行业普遍认为,当下的机器人不会一下全面落地,但已经可以在局部场景中工作。它的能力不会在同一时间点向所有人显现,而会随着不同任务逐步成熟,逐步落地到不同场景。最终,会让普通用户在生产生活中实现低门槛地使用。
原力灵机CEO唐文斌认为当前具身智能在「GPT-1.0或2.0,而不是3.0或3.5」的阶段,但他同时表示,「具身智能不见得要100%通用才能用。」如果机器人能在有限任务上达到较高成功率,场景允许容错,经济账也能成立,就可以先运行起来。
这意味着,具身智能落地的更现实问题,不是等待一个类GPT时刻的全能模型,而是寻找与现有能力相匹配的场景。
星海图创始人兼CEO高继扬进一步解释说,这个落地过程是随着能力边界逐个场景解锁的。机器人可能先出现在实验室和展馆,再进入仓库、工厂和家庭,不会像语言模型一样,通过一个对话框被大量用户同时感知。
但是,最终具身智能会如破壳机器人创始人许华哲在昆仑万维「世界模型与多模态范式跃迁」专场论坛上判断的那样,做到常见任务零样本执行,困难任务即使需要适配,也只需少量数据和较短时间。这要求具身智能离开公司和实验室,被放到不同用户手中之后,能理解用户通过对话表达的需求,去完成任务。
因此,具身智能可能不会只有一个GPT时刻,而会在不同场景里出现许多个「小节点」。比如,100台机器人开始在仓库持续作业,同一套模型能够迁移到不同本体,家庭机器人可以稳定完成多类任务等。
这决定了具身智能的落地必然是渐进的。
高继扬将这条路径概括为「从开发者到生产力」。开发者、科教研和展演娱乐对机器人生产力的要求相对有限,可以较早形成市场;物流和部分工业环节,会要求机器人稳定完成明确任务;家庭、农业和建筑等开放环境,则需要更强的理解、操作和适应能力。
![]()
生产场景内部也会存在清晰的推进顺序。搬运、码垛、拆垛、分拣和打包主要是厘米级操作,可以较早进入;插拔、线束、装配和服装加工需要毫米级精度,会稍晚进入。
场景并不是按照行业标签依次开放。真正决定先后顺序的,是任务能否被稳定定义,失败是否可以被接管,机器人能否长时间运行,以及模型和本体是否已经达到相应精度。
这种渐进式的推进,会被形象地比喻为「打童工」。唐文斌认为,「打童工非常重要,但需要点技巧」,要让机器人能在有保护的环境下工作,允许失败,但有额外流程兜底。这种在能力匹配、具有保护机制的环境中探索落地的过程,能让行业更快转起来。
![]()
支撑落地的三种能力
一次演示成功只能证明能力存在,一批机器人持续工作,才能证明生产力开始形成。而具身智能的最终落地,要在渐进式地探索中解决三个问题:能不能理解任务;能不能通过合适的身体完成任务;以及能不能把工作经验转化为下一轮能力。
首先,机器人不仅要执行指令,还要理解陌生环境、拆解任务,并判断一个动作会带来什么结果。
现阶段的主要路线是模型通过预训练获得基础泛化能力,再利用后训练适应具体岗位。高继扬认为,预训练解决机器人到了新场景「会不会做」,后训练则像工人上岗前的培训,解决「做得够不够快、够不够稳」。
原力灵机推出通用具身基础模型DM0.5,覆盖导航、抓取和全身控制,强调零样本、后训练、原生记忆和多本体泛化。星海图的G0.5面向作业智能,希望机器人通过语言理解任务、调用身体完成工作。二者都在推动模型从固定动作,走向开放环境中的泛化。
世界模型被寄予厚望,是因为它可能让机器人具备更强的理解、泛化能力。昆仑万维董事长方汉认为,具身智能未来的竞争不会只停留在某一台机器或者某一项任务上,「谁能训练出在陌生环境里仍然能看得懂、做得对的通用模型,谁就能拿到物理智能时代的入场券。」
除了发布Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐模型,昆仑万维旗下的黎曼动力还在世界人工智能大会期间介绍了Riemann-1.0具身世界动作模型,提出全因果世界动作建模架构与三阶段渐进式具身预训练框架,不仅要在输入端对环境进行理解,还要在输出端让模型对未来进行预测和仿真,形成一个闭环。
![]()
破壳机器人刚完成亿美元级 Pre-A 轮融资,其核心技术路线也包括WAM(世界动作模型)、RL(全链路真机强化学习)与DATA(高质量真实世界数据)。他们在聚焦机器人操作,做到让机器人同时理解物体属性、空间关系、接触方式、动作后果与任务目标。
其次,模型最终需要一具身体进入物理世界,但这副身体并不必然是人形。
本体的多元化,不只是技术路线尚未收敛的暂时结果,更是物理任务本身存在的差异。仓库地面平整、通道固定,轮式双臂通常比双足更加高效;农业和建筑环境缺少平整道路,双足形态才可能体现价值;机器人一旦进入家庭,尺寸、噪声、碰撞风险和人与机器的距离,又会成为新的约束。
因此,原力灵机Apex将手臂、夹爪和底盘做成可组合模块,希望根据负载和任务拼出不同本体;启元Q1把全身力控压缩进88厘米机身,解决机器人如何安全进入人的亲密距离;T1可以在轮足人形和四足形态之间切换,以兼顾室内移动和户外地形——大家都在用更合适的身体把具身智能送进具体环境。
![]()
在模型和本体之间,还需要一层工程系统——后训练框架、MaaS、操作系统的完备程度,决定了机器人能否被开发者快速部署到场景中。这样,本体就会同时承担两种作用:一方面,它是大脑和工程系统接触真实世界的载体;另一方面,它也是被客户购买和使用的商品。
最后,具身智能要能从工作中继续学习,形成场景化数据闭环的能力。
人类第一视角数据成本较低,适合学习任务流程和基本物理常识;仿真数据可以扩大环境和试错规模;真机数据则能记录接触、摩擦、形变和失败。原力灵机、星海图和破壳机器人都在强调真机数据的获取,重视机器人进入真实业务后产生的反馈。
这背后是数据价值衡量标准的变化,面向真实场景落地的过程中,动作与指令是否准确对应,数据中有没有失败和异常,最终能不能提高真实任务成功率,都比单纯扩大规模更重要。过去是先采集数据、训练模型,再寻找应用;接下来,机器人在实践中产生数据,数据推动模型提高,模型再承担更多工作。
探索Door-to-Door移动任务的正奇未来就在直接面向人类真实生活的复杂场景,进行数据采集,在人车混行、室内外切换、电梯信号中断、小区路面积水、小型犬/外卖车/儿童突然闪现等各种corner case中博弈。他们认为,机器人能带着用户在光线昏暗的雨夜找到附近诊所,才更能满足日常生活中的真实需求。
场景由此从训练的终点,变成下一轮训练的起点,也在让具身智能公司业务越做越全。模型需要后训练、操作系统和硬件适配,本体需要更适配场景的部件开发,场景还需要调度、运维和人工接管。具身智能的落地,已经不是一个单点技术可以驱动完成的生意。
![]()
不同场景,不同的成长任务
理解、执行和学习能力,最终都要进入场景去创造价值。但不同场景承担的任务并不相同:开发者场景帮助行业扩展工具和生态,展演场景训练交付能力,仓库和工厂检验生产力,家庭则要求机器人面对最复杂的人和环境。
星海图过去服务的数百家机构开发者中,既包括高校和企业研究团队,也包括机器人创业公司。这个市场购买的不是已经成熟的生产力,而是整机、模型接口和开发能力。它能够帮助企业发现硬件适配和工具链问题,也能让更多人围绕同一平台开发技能。
展演场景同样不要求机器人独立完成高价值劳动,而是通过内容和现场运营产生收入。擎天租提出RaaS+,将机器人、内容创意和场景运营组合起来,试图把一次性快闪变成可以在旅游、体育、时尚和文艺活动中重复交付的服务。展演不是最终的生产力市场,却可以训练多机调度、现场安全和跨本体管理。
![]()
这两个相对成熟的应用场景之外,具身智能也开始进入仓储搬运、物料转运、物流分拣、产线上下料等生产场景。这些任务相对明确,节拍可以适度调整,又能通过大量SKU接触丰富对象,同时存在大量脏、累、重复和招工困难的问题,需要让机器人来填补这些岗位缺口。
这种场景的落地难点更多出现在现场适配。地瓜机器人CEO王丛认为,搬运、物料转运、分拣和上下料已经具备一定技术基础,但不同工厂的货架、设备、流程和管理系统差异很大。而且,随着精度提高,机器人还要从搬运、分拣,进入插拔、线束和装配,对本体控制和现场工程提出更高要求。
机器人落地不只是进入工厂,还要接入工厂原有的生产体系。原力灵机选择用Ferrata来攻克这个难点,在仓库中对自动化设备、不同形态机器人和人工进行重新分工。标准、确定的任务继续交给传统自动化设备;机器人处理对象变化更大、规则更复杂的部分;模型失败时,由遥操作或者人工接管。
![]()
生产场景可以依靠单一任务的高频重复形成ROI,生活场景任务却零散、多样,用户不会为了一个低频功能购买昂贵机器人,更不会接受它频繁被卡住或等待接管。
其中已经有不少尝试。乐享科技从运动和多模态交互能力入手,提供全屋移动、老人看护、移动拍摄和情感陪伴。启元机器人致力于创造更适合C端消费市场的产品,Q1用小尺寸和柔顺力控降低近距离交互压力,T1通过跨形态移动适应室内外环境。
正奇未来首个落地场景,选择的短途移动任务,倾向C端生活。这有点接近生产场景「从使用场景入手、生产数据」的逻辑,先用高频需求形成产品入口,再由真实使用推动QUORRA DoorMind世界模型迭代。他们希望通过产品QUORRA一步X5的量产出货,来撬动该场景的数据飞轮,做到人用车,车懂人;然后车更好用,人更多用车。
家庭机器人现阶段还不能直接挑战包办全部家务,但可以先在移动、看护、陪伴或者短途出行中建立持续使用的理由。
就像原力灵机在Ferrata场景中强调的,具身智能走向场景落地,最终要让经济飞轮和数据飞轮同时转起来。
其中,经济飞轮要求具身智能通过持续作业创造可以计算的价值,部署规模扩大后,制造、运维和交付成本继续下降;数据飞轮要求具身智能在工作中产生成功、失败、接管和异常数据,模型因此提高,再承担更多任务。
只有数据飞轮,没有经济飞轮,客户不会长期为技术试验买单;只有经济飞轮,没有数据飞轮,机器人可能停留在另一种定制化自动化设备,无法获得「学得越多越聪明」的规模效应。
这两个飞轮形成的过程,就是具身智能走出学校进入社会的过程。当经济飞轮和数据飞轮开始相互推动,量产出来的机器才真正有机会变成社会生产力。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.