![]()
![]()
编辑:前沿在线 编辑部
2026 年的 WRC 上,更新完成的 C 馆首次全面启用。
更高的层高让参展商们把展台搭得比往年更大更立体,整个场馆的视觉冲击力远超往届。
自变量的展位在 C 馆里相当醒目,头顶悬着一个巨大的 X 形 logo。
除了正面的主背景板,另外三个方位分别铺开了家庭服务、物流分拣、灵巧手操作和无本体数采四个展示区。
站在展台中央往四周看,等于同时把自变量的整条技术链路看了一遍。
![]()
一台双臂机器人正在给软包快递翻面。
夹爪下去,在空中完成翻转,借重力调整落地角度,面单朝上,稳稳落在传送带上,整个过程大约半秒。
展台另一侧,另一台机器人从冰箱里取出一罐可乐。
![]()
再往前走,它在铲猫砂,干活的间隙还会拿起宠物玩具,逗一逗旁边的机器狗。
拐角处,五指灵巧手拆开风扇包装盒,拧开开关,然后通过扇叶是否转动和前方红色丝带是否飘动的双重视觉反馈,确认风扇真正启动后给围观观众送风。
![]()
不远处,一台人形机器人夹起观众指定颜色的花束,插进花瓶,递到你手里。
今年自变量展台还有个特别之处,配了工作人员做情景剧式的现场解说。
![]()
说实话,机器人光在那儿演示,很多大众观众是看不懂所以然的,叠衣服、拆包装、拧开关这些动作到底厉害在哪里,没有讲解很难体会。
有了解说员现场拆解,不少观众站在那儿就听入了迷,连我这种天天关注具身智能的人也觉得学到了不少东西。
插花那个互动环节尤其能说明问题。
观众随口报一个颜色,机器人就要从红、白、粉三种玫瑰里精准找出对应的那一朵,整个过程没有预设脚本,全靠模型实时把自然语言指令对应到真实花材上。
![]()
这种即时的人机交互,比任何技术参数都更能让人直观感受到,当机器有了大脑之后,到底意味着什么。
这些场景之间没有直接关联。但驱动它们的是同一个模型,WALL-B。
2026 年的世界机器人大会,一个明显的变化是,参展商们不再只比谁的动作更炫、谁的硬件更贵,而是开始比谁真正走进了真实场景。
![]()
好看和好用,正在成为这个行业的两个物种。
自变量是这场变化中比较有代表性的一家。它同时拿出了家庭服务和物流分拣两个落地场景,加上无本体数采方案,构成了一条从数据到模型再到应用的完整链条。
展台上的家庭和物流两个场景,都不是为大会专门搭建的表演,而是来自已经规模化落地业务的 1:1 复刻。
这背后折射的,是具身智能行业正在发生的一次范式转移。
![]()
"通用" 被用窄了:一个场景里的一百件事,不是真正的通用
具身智能过去几年的发展,有一个绕不开的阶段,Demo 竞赛。
各家公司在展会上展示机器人跑跳、翻跟头、做后空翻,或者在精心布置的场景里完成指定任务。这些展示对于技术验证有价值,但距离真实应用还有相当的距离。
![]()
原因在于,Demo 场景是可控的,物品是预设的,指令是固定的,而真实世界充满了不确定性。
2026 年的 WRC 上,这个趋势正在发生变化。
越来越多的参展商开始强调真实落地,而不只是技术演示。但真正能拿出规模化落地案例的公司,仍然是少数。
还有一个值得注意的现象。逛展的时候有个直观感受,几乎每家都在说自己用了 "通用基座模型",但走一圈下来会发现,大家演示的东西差别不大,无非是抓取、摆放、叠件衣服、递瓶水,动作清单高度重合。
但凑近了看会发现一个共同点。
不管演示的是叠衣服还是递饮料,机器人的脚基本没挪过窝。动线是提前画好的,物体是反复练过的,模型在同一个方框里能变出一百种花样,可第一百种和第一种之间,差的只是动作列表的长度,不是能力的边界。
这就引出一个问题,"通用" 到底指什么?
过去说一个模型通用,说的是它换个场景、换台身体、换类任务,照样能干活。现在这个词的用法悄悄变了,更多时候是说在同一个展台布景里,能演示的功能多不多。
这就像一个厨师只会做一道菜,但能在这道菜里加一百种配料。这不叫厨艺全面,叫配料丰富。
真正该拿来衡量通用模型的,不是功能清单有多长,而是离开预设场景之后还剩多少本事。能不能从一个环境走进另一个环境,不用重新调教、不用推倒重来,这才是通用二字该有的分量。
按这把尺子重新打量今年的 WRC,值得驻足的展台并不多。自变量的展位是其中之一。
自变量的思路是,选择两个差异最大的场景同时切入。
家庭是高度非结构化的 C 端场景,物流是半结构化的 B 端场景。两者对能力的要求截然不同,家庭要泛化和应变,物流要效率和稳定性。
![]()
从任务本质来看,做家务是长程任务,每一种家务差异都很大,机器人需要在很长的时间跨度内连续做出大量决策和判断。
物流分拣则是不断重复的短程任务,每一次分拣动作看似简单重复,但每个包裹的形状、重量、材质都不同,因此每一次重复都要重新做一次决策。
同时做这两件事,在战略上有一个清晰的逻辑。如果一个模型能同时在这两个差异显著的场景里跑通,那就证明了通用模型路线的跨场景迁移能力是成立的。
而跨场景迁移能力,恰恰是具身智能能否实现规模化普及的关键前提。
这个逻辑的反面是,如果每个场景都需要单独开发一套系统,那具身智能的落地成本将永远降不下来,行业天花板也清晰可见。
从这个角度看,自变量同时展示家庭和物流,不是贪多,而是在验证一条更底层的产业路径。
![]()
家庭场景:通用能力的终极试验场
家庭被称为具身智能的终极场景,这个判断有其产业逻辑。
每家的户型、家具、光照、物品摆放都不同,任务长程且随机,用户的指令自然语言化且模糊。
这种环境无法靠预设规则覆盖,也无法靠后训练穷举,它迫使机器人必须具备真正的环境理解和动作规划能力。
自变量选择家庭场景,核心价值不只是做一门家政生意,而是拓展模型的能力边界。
让机器人进入真实家庭,接触真实的用户需求,在品类繁多的家务任务、动态变化的居家环境和自然人机交互中,不断探索能力的边界在哪里。
![]()
展台上呈现的,是行业最为丰富的真实家庭场景任务。
叠衣服、取外卖、拿可乐、收拾茶几、整理鞋柜、套垃圾袋、浇花、铲猫砂、粘猫毛、关灯,十多项任务覆盖了日常生活的多元细分需求。
这些能力全部来自规模化入户的真实需求打磨,而不是实验室里的概念设计,这也让自变量成为目前离家庭服务最近的具身智能企业。
今年 3 月,自变量联合 58 到家推出智能保洁服务,保洁员带机器人协同上门,这是机器人行业首次大规模实现机器人进家庭服务。
![]()
5 月启动 "X 家庭成员计划",机器人常驻用户家中最长一个月。
这两个项目的核心产出,不只是服务了多少用户,而是探索了多少次能力的边界。
这些数据的价值在于,它们是在非结构化、不可控的真实环境中产生的,包含了各种异常情况、用户反馈和任务失败案例。
机器人只有在真实场景里去摸索和失败,才会不断成长。对于通用模型的训练来说,这类数据的价值远高于实验室里采集的标准化数据。
通过持续处理这些真实任务,模型在环境理解、柔性执行、常识推理等底层通用能力上不断打磨,逐步形成家庭服务的完整闭环。
硬件层面,机器人搭载了 2D 雷达和 RGBD 相机等多类传感器,配合超窄底盘和路径规划算法,可以在用户无感知的状态下完成建图,识别家中的布局和物品分布,在家具之间灵活穿行。
自变量的家庭展区有个细节值得注意,它没有只搭一个客厅就完事,而是把客厅和餐厅两个功能区同时还原了出来。
这两个空间的脾气完全不同,客厅开阔、家具偏矮、人可以随意走动;餐厅被桌椅占满,通道窄、障碍物多。
机器人从客厅走到餐厅,不只是换个地方站着,它面对的是一整套不同的空间规则和任务类型,得重新判断该怎么动、该避什么、该在哪儿干活。
![]()
整个家庭系统的运行也不是单靠模型端到端输出,而是由一套综合智能系统来统筹。系统以机器人的自主决策为核心,内置专家安全机制保障最终的服务品质。
几个技术细节能反映模型的实际能力。叠衣服时,机器人需要识别领口袖口,理解衣物拓扑结构,根据实时褶皱状态调整抓取点和力度。
铲猫砂时,机器人不会简单抖两下就倒掉,而是会抖到最后确认有没有猫便便,没有的话就重新铲一铲再接着抖,动作逻辑和真正的铲屎官别无二致。
![]()
这背后要在宠物活动的环境中保持安全距离,控制抓取、筛动、倾倒的力度。
粘沙发猫毛时,目标细小且附着在不同材质表面,机器人要用二指夹爪操作粘毛工具,把服务范围从地面延伸到立体空间。
这些任务的共同特点是,都涉及柔性物体操作和非结构化环境感知,而这恰恰是传统机器人最难处理的领域。
自变量的家庭项目入选了APEC 数字周《亚太地区数智赋能案例集》,是其中唯一的具身智能民生案例。
![]()
从产业发展的角度看,家庭场景的率先突破具有示范效应,一旦通用模型在家庭环境中证明了泛化能力,它向其他非结构化场景的迁移就有了基础。
![]()
物流分拣:通用智能的商业化压力测试
如果说家庭场景验证的是泛化能力,那物流分拣验证的就是商业化可行性。
物流分拣是一个产业痛点非常明确的场景。行业发展了几十年,大部分环节已经自动化,唯独分拣这一步仍依赖大量人工。
![]()
这里有一个行业背景值得说明,国内主流的快递扫码方案是五面扫,也就是说快递面单不能朝下,否则扫码设备无法识别。
因此机器人的核心任务,就是把形态各异的包裹以最高效准确的方式,让面单不朝下地传递到下一环节。
包裹的大小、形态、材质、面单状态各不相同,节拍要求高,容错率低,传统自动化设备覆盖不了这种高柔性场景。
这个场景的好处是,ROI 可以算得很清楚,每小时分拣多少件、准确率多少、故障率多少、替代了多少人工、投资回报周期多长,这些数字都是硬指标。
WRC 前夕,自变量做了一场公开直播实测。双机械臂加夹爪的方案,面对形态随机的真实包裹,连续无脚本作业下分拣效率达到 1816 件每小时,综合成功率 98%。
作为对比,美国 Figure AI 公开的平均效率是 1248 件每小时,自变量高出 45% 以上。
![]()
成本方面,自变量用双臂加夹爪,Figure 用人形加五指灵巧手,硬件成本差距约 70%。换句话说,自变量以约 30% 的成本实现了 45% 的效率提升。
还有一个容易被忽略的对比维度。自变量处理的是形态随机的真实物流件,纸箱、泡沫箱、圆筒状快递、柔软衣物包裹混杂在一起,面单位置毫无规律。
而部分同行在公开演示中使用的是定制的标准尺寸盒子。测试条件的差异,让效率数据的含金量并不在同一个起跑线上。
这里有一个容易被误解的点。自变量合伙人兼算法负责人甘如饴曾明确表示:"大家可能会认为,灵巧手对大模型技术要求更高。恰恰是用更简单的机械臂加夹爪做分拣,对具身大模型的要求更高。"
原因在于,灵巧手的高自由度可以通过硬件代偿一部分操作难度。
普通夹爪开合只有两个自由度,而五指灵巧手有 22 个,不同手指可以承担插入、支撑、拨动、抬升等不同作用。自由度越高,硬件本身的容错空间越大。
而标准夹爪自由度有限,要完成复杂的包裹操作,几乎全部依赖模型对物理世界的理解和实时决策能力。用更简单的身体完成更复杂的任务,这本身就是模型能力的证明。
![]()
这组数据的产业含义值得拆解。它挑战了行业过去的一个惯性假设,即要提升性能必须堆叠更复杂的硬件。
自变量的实践指向了另一条路径,用模型的泛化能力和控制精度替代硬件复杂度。
这条路径如果成立,对整个具身智能行业的商业化进程都有影响。因为它意味着,机器人的落地成本不一定要等硬件降价,模型能力的突破本身就能带来成本结构的优化。
夹爪方案的优势是系统性的。
结构简单、零部件少、故障率低,不需要精密校准和专项维护,长期运维成本低。双臂机械臂可以直接对接现有分拣工位,不用大规模改造产线,落地周期短,可快速复制到不同仓储场景。
![]()
目前自变量已经一家头部物流企业达成合作,将方案部署到真实生产环境。这一步的战略意义在于,它让自变量的技术从展台演示进入了企业级生产系统的验证阶段。
作为物流企业,对生产效率和稳定性的要求是行业最高标准之一,能通过其考验,本身就是一种技术能力的体现。
更值得注意的是研发周期。
从研发到形成当前物流分拣方案,自变量用时不足三个月,而海外同行在同类场景上的投入通常以年计。这个差距的根源不在于工程团队的效率差异,而在于底层基座模型的泛化能力。
通用模型足够强,新场景就不需要从零开始搭建。
展台上的一些操作细节也值得关注。面对混乱来料时,机器人会优先处理最好抓或最近的包裹,一只手操作时另一只手已开始处理下一件,形成类似 "一脑多用" 的协同。
![]()
包裹没翻成功或被推到边缘时,模型会尝试补救而不是停机。
异形件第一次没推到位,机器人会先处理别的再回来补推,不会因单一失败卡住整条线。
真实产线中的异常情况更复杂。
如果前一件包裹因为下游传送停滞仍停留在工位上,机器人会通过传感器实时检测包裹状态,识别异常并自主处置,避免问题继续向后端传递,降低包裹面单朝下、双票回流或错发的风险。
这些能力不是预设规则,而是模型实时推理的结果。
在高强度、高确定性的生产级任务中,WALL-B 的调度效率、运动精度、故障容错和 7×24 小时持续作业能力都得到了验证。
它说明通用智能已经可以转化为可量化的产业效率,也为自变量后续切入生产制造等更广泛的工业场景打下了核心基础。
![]()
WALL-B:通用模型路线的底层答案
家庭和物流同时跑通,底层支撑是WALL-B。
WALL-B 发布于今年 4 月,是全球首个基于世界统一模型架构的具身大模型。
它没有采用传统 VLA 模型拼接视觉、语言、动作模块的路线,而是将所有能力放入同一个神经网络从零联合训练。这两种技术路线的差异,本质上是对具身智能终局形态的不同判断。
![]()
自变量创始人兼 CEO 王潜在 WRC 主题演讲中给出了一个核心判断:具身智能需要的不是把语言模型或多模态模型搬到物理世界,而是一个平行于数字世界的、专门服务于物理世界的基础模型。"就像大语言模型是数字世界的基础,物理世界也需要自己的基础模型。"
![]()
他的依据来自对人脑的观察。人脑中负责精细操作的脑区规模,几乎和语言、高级思维相当,这意味着操作任务的复杂度不亚于语言本身。
更关键的是,在所有脑区中,只有最高级的、负责手部操作的皮层拥有直达脊髓的跨层直连,其他脑区都是一层一层向下控制。
"所以大自然其实就是这么设计的,一个完全端到端的模型,在最高级皮层上直接控制最低级的动作。" 王潜说,"端到端不光是人类的最佳实践,也是大自然设计的结果。"
WALL-B 的世界统一模型架构,可以用苹果 M1 芯片的统一内存来类比。
在 M1 之前,CPU、GPU、内存各自独立,数据在模块之间搬来搬去,搬运本身就是性能瓶颈。M1 把所有处理单元放到同一块内存上,瓶颈消失了。
WALL-B 把视觉、语言、触觉、动作和物理预测全部放进同一个端到端神经网络,从零开始联合训练。
这意味着看到一个软包这件事,和理解它会变形、决定用什么角度夹、预测夹下去会发生什么,是在同一个表征空间里同时完成的,没有模块边界,没有信息损耗。
![]()
这个架构选择不是纸面设计,而是实战逼出来的。
自变量第一代模型 WALL-A 采用的就是传统 VLA 架构,正是在真实家庭场景的部署中,团队直接看到了模块化拼接的天花板,才从底层架构开始重写,产出了 WALL-B。
围绕 WALL-B,自变量构建了全栈自研的技术体系。
模型层面有 WALL-WM 事件级世界模型和 WALL-OSS 开源系列。
数据层面有 Quanxta Zero 无本体数采方案和全链路数据生产系统。
基础设施层面有 DMuon 分布式优化器、HOST 单样本学习框架、X-Tokenizer 动作分词器,以及自研的分布式训练和高性能推理框架。
硬件层面自研了量子一号、量子二号两款机器人和物流分拣用的高性能 6 轴机械臂,灵巧手则采用行业头部厂商产品,驱动它完成复杂任务的是自变量自研的具身大模型。
![]()
其中 HOST 框架值得一提。
传统机器人学习一个新技能,通常需要工程师遥操作演示几十次,再花几个小时做监督微调。
HOST 把这个过程压缩到了单样本级别,机器人只要看一段几十秒的人类演示视频,就能当场上手,期间完全不需要更新模型参数,因此也不存在学新忘旧的问题。
这意味着自变量进入新场景时,调试成本和周期会大幅降低,用户自己演示一遍,机器人就能学会。
只有全栈自研,才能实现从数据采集、模型训练到真机部署的全流程深度优化。自变量公开的数据是,这套全流程的工作周期可以从 6 个月缩短到 3 天。
从战略视角看,自变量的全栈布局实际上是在构筑一条难以复制的护城河,单一技术点的领先容易被追赶,但从数据到模型到硬件的全链路闭环,需要长期的、系统性的投入,后来者的追赶成本会非常高。
![]()
数采基建:通用能力持续进化的燃料
在自变量的 WRC 展示中,无本体数采方案 Quanxta Zero可能是最容易被观众忽略、但战略价值最高的一块。
![]()
具身智能的核心瓶颈是数据。
和大语言模型不同,具身智能需要的是物理世界的交互数据,包含视觉、触觉、动作、力反馈等多模态信息。
这类数据的采集成本极高,传统遥操作方案占地方、速度慢、对采集员要求高,导致数据规模始终上不去。
关于数据,行业里有一句流行的话,"数据是具身智能的石油"。但王潜明确反对这个比喻。
![]()
在他看来,石油是标准化的大宗商品,开采出来就是开采出来了,是一种资源性质的东西。
而具身数据不应该是资源,它是某种意义上极度复杂的工业品,做好数据的复杂度甚至高于做好一个模型。
很多公司收了很多数据,收完发现没什么太大用处,根源就在于对数据的工业品属性缺乏认识。
Quanxta Zero 用定位头环加智能双夹爪实现全身移动采集,定位精度毫米级,采集员可以正常走动、下蹲、转身,速度接近自然操作。
数据维度上提供视觉、触觉、听觉全模态采集,各维度数据的时间同步精度约 1ms,从硬件层面就完成时间对齐。
采集的数据实时上传云端,经过清洗、自动化标注、质量控制和数据增广等环节,数据入库有效率超过 85%,落盘后可直接用于模型训练。
![]()
经模型闭环验证,用大量无本体数据加少量真机数据混合训练,效果可追平纯海量真机数据训练的模型,但训练数据成本可降低 90%。
这套方案的战略意义有两层。
第一层,它解决了自变量自身的数据供给问题,家庭和物流场景的模型迭代都需要持续的数据输入,有了高效的数采方案,数据飞轮才能真正转起来。
第二层,它可能成为自变量对外输出的一项基础设施能力。
数采工具正在从机器人公司的内部设备,长成一条单独的产业链。
如果自变量的数采方案成熟到可以对外开放,再加上 WALL-OSS 开源基座,就能形成从采集、训练到验证的完整开发者闭环。
那自变量就不只是一家机器人公司,而是一家为整个具身智能行业提供数据基础设施的公司,这个定位的产业价值可能比单做机器人更高。
![]()
Quanxta Zero 还具备行业唯一的 "移动采集数据本体回放" 能力,即数采员采集的一条数据可以在不同本体的机器人上直接复现。
这意味着数据的复用率大幅提升,一次采集可以服务多种硬件平台,进一步摊薄了数据成本。
![]()
通用路线的长跑,才刚刚开始
把自变量的布局放在整个具身智能行业的坐标系里看,它的战略轮廓是清晰的。
以 WALL-B 通用模型为核心,向上支撑家庭和物流等多场景应用,向下通过全栈自研的基础设施和硬件实现深度优化,同时通过 Quanxta Zero 数采方案构建数据飞轮。
![]()
这是一条从数据到模型到应用的完整闭环,每一环都在为其他环节创造正向反馈。
这条路线的核心赌注是,通用模型的跨场景泛化能力将成为具身智能规模化普及的关键。如果这个判断正确,那么自变量当前的全栈投入将在未来几年转化为难以追赶的先发优势。
行业大环境也在支撑这个判断。
2026 年上半年,国内具身智能赛道融资总额达到 935 亿元,融资事件 322 笔,同比增长 137%。在融资规模 TOP20 的公司中,大约四分之三与大脑和数据直接相关。
资本层面,自变量两个多月内连续完成 4 轮融资,估值突破 200 亿,投资方涵盖小米、美团、阿里、字节跳动、红杉中国、IDG 资本、中国移动链长基金等 30 余家机构。
从商业逻辑来看,通用模型路线带来了几个根本性变化。
交付不是终点而是起点,机器人在真实环境中持续积累经验,越用越聪明。边际成本递减,模型处理新场景的能力越来越强,每进入一个新行业所需的定制开发越来越少。
![]()
异常处理能力持续提升,跑得越久遇到的边界情况越多,鲁棒性越强。
当然,行业仍处于早期。技术迭代速度快,市场格局远未定型,通用路线和垂直定制路线的竞争还会持续很长时间。
但从产业发展的规律来看,能够跨场景复用的通用能力,最终会在成本和效率上建立结构性优势。
对普通消费者来说,短期内可能不会直接买到一台全能家用机器人,但会越来越多地在生活场景中接触到它们。
家政服务里出现机器人搭档,酒店里有机器人送餐,写字楼里有机器人巡逻。物流分拣方案的规模化部署,最终可能体现在快递速度更快、错分率更低。
具身智能的普及不会一蹴而就,但方向已经比较明确了。
2026 年的 WRC 可能会被记住,不是因为某一个特别惊艳的 Demo,而是因为它标志着具身智能行业从技术演示阶段正式进入了场景落地阶段。
![]()
在这个转折点上,自变量的位置比较靠前,它的布局方向也比较符合产业发展的长期逻辑。
接下来的一两年,将是验证这条路线的关键窗口期。
物流产线的运行数据、58 家政的规模化进展、X 计划的用户反馈、从物流向下一个工业场景的迁移速度,这些指标将共同决定自变量能否把当前的先发优势转化为持久的市场地位。
自变量已经站上了起跑线,而且跑得不慢。
![]()
![]()
前沿动态前沿大会
前沿人物
点「在看」,给前前加鸡腿
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.