梦瑶 发自 凹非寺
量子位 | 公众号 QbitAI
抓马!!!
不是,谁家机器人敢在实时直播里这么玩啊——
没有人工兜底,没有固定流程,甚至连包裹都是随机来的,就这样连续稳定干满1小时,分拣效率干到了1816件/小时!?
![]()
更关键的是,这一实测成绩,还超过了美国Figure AI此前公开的1248件/小时平均效率纪录,分拣效率提升超过45%。
这次物流分拣直播所使用的双机械臂+夹爪的硬件方案,则比Figure AI此前的人形机器人+五指灵巧手方案,硬件成本大幅下降70%。
直播物流分拣的准确率,则达到98%的行业最前沿水平。
要知道,此前Figure AI的物流分拣直播一直被视为具身智能领域的标杆案例,国产模型这波操作是真·卷麻了:
![]()
如此魔幻的一幕,就发生在刚刚结束的自变量机器人「夹爪方案挑战1248件/小时物流分拣」公开直播实测。
不靠全身人形机器人,也没有搭载五指灵巧手,仅凭双臂+标准夹爪方案,就完成了更高的物流分拣效率。
而支撑这一表现的核心,正是其背后的具身智能「大脑」——
依托自研WALL-B世界统一模型,自变量机器人能够面对形态、大小、材质各不相同的随机包裹,实时理解环境并调整动作策略,交出了这份成绩单。
从家庭到物流,从高成本硬件部署到模型能力驱动,一条更高性价比、更适合规模化落地的具身智能路径,正在中国具身智能探索过程中加速形成。
具身模型一小时狂拣1816件异形包裹,直接碾压Figure AI!
讲真,对于机器人demo动作演示这事儿,大家伙估计在各种厂商宣传视频里已经看过不少。
左钩拳、右踢腿,一套动作行云流水,视觉效果确实足够震撼,分分钟让人直呼哇塞。
但镜头里的高光时刻,距离机器人真正走进产业现场,中间其实还隔着一道不低的「门槛」……
因为一段提前设计好的动作,可以通过数据采集、轨迹调优,再针对特定环境反复训练,最终呈现出稳定的效果。
可一旦进入真实物流场景,机器人面对的就完全是另一套考验,持续运转的传送带、不断变化的包裹,以及随时出现的未知情况,非常考验其对于真实世界的感知、判断和决策能力!!
这也是自变量机器人这次公开直播实测「夹爪方案挑战1248件/小时物流分拣」最有看头的地方~
![]()
要验证模型到底有没有处理复杂分拣任务的本事,第一关就是把测试「工况」的难度直接拉满。
相比美国Figure AI此前直播测试中以规整度较高的标准包裹为主、抓取条件相对可控的场景,自变量机器人这次直接把真实仓储现场最棘手的变量搬到了直播间——
没错,传送带上的包裹完全随!机!混!合!
纸盒、快递软袋、圆柱形快件,甚至泡沫封装的生鲜件同时出现,不同包裹在形态、重量和尺寸上都存在明显差异,这波真·地狱级难度了:
![]()
此外,在摆放位置上,所有包裹位置也没有刻意摆正,而是保持随机姿态,尽可能还原真实仓库中人工投放后的状态。
这也意味着,固定点位和预设轨迹基本派不上用场……(doge)
机器人必须根据眼前不断变化的情况,实时完成识别、判断、规划和抓取,而这也成为对具身智能模型泛化能力的一次直接检验!
![]()
难度已经拉满,接下来就看小机器人怎么接招了~
开抓之后,画面中就出现了一个小细节,面对同一条传送带上的包裹,夹爪几乎没有重复执行同一套搬运动作。
基于WALL-B模型能力,机器人先感知到了包裹属性,并且根据当前情况匹配到了对应的作业策略。
比如面对重量较轻、形态规整的包裹,夹爪会直接完成抓取和搬运,动作干脆利落,尽可能提高整体吞吐效率。
而遇到较大、较重的箱体时,机器人则会切换策略,通过双臂协同完成搬运;碰上夹取条件不理想的箱体,还会从侧面逐步推移,在保证效率的同时降低包裹受损风险:
![]()
这种随机应变的能力,在后续「面单整理」环节体现得更加明显。
比如面对小件包裹时,夹爪会借助惯性快速翻转,提高处理效率;遇到重量更大的包裹,则会分步骤缓慢调整,避免因受力过猛导致偏移。
面对衣物类软包这类容易变形的物体,夹爪还会先通过拨动、展开等动作让包裹恢复平整,再进一步寻找并校准面单位置。
看似只是简单完成一次翻面,背后实际上包含了对物体材质、重量和形变特性的判断,以及对应的动作规划与力度控制。
![]()
于是,现场呈现出来的并非一套动作的机械重复,而是一连串根据实时情况做出的临场选择——
该快的时候快,该稳的时候稳,碰到不好处理的包裹,也知道换一种方式继续完成任务。
更重要的是,整场直播连续作业期间,全程没有人工接管,也没有出现故障停机。WALL-B就这样一边感知、一边决策、一边调整动作,连续完成了1小时无固定脚本测试。
最后,成绩定格在1816件/小时。
相比Figure AI此前公开的1248件/小时平均效率,自变量机器人的有效分拣效率提升超过45%。
一场直播看下来,不得不感叹一句,国产具身模型这波是真的卷麻了,现场变招,小机器人愣是一路稳稳接住~
不堆高成本硬件,机器人如何突破复杂场景的效率上限?
回看这场物流分拣实测直播,除了碾压Figure AI的1816件/小时的成绩外,我们还发现一个相当值得细品的地方。
那就是这套实测方案的硬件配置,可以说是非常之「朴素简约」。。。
双机械臂,加上标准夹爪,没有五指灵巧手,也没有继续堆叠复杂的末端结构。
但面对形态、重量和姿态不断变化的包裹,机器人依然能够见招拆招,最终还把效率推到了Figure AI公开成绩之上。
真正支撑这一切的,正是藏在小机器人背后的「大脑」——
全球首个基于世界统一模型(WUM)架构的具身智能大模型WALL-B。
![]()
大家都知道,过去几年具身智能行业最主流的一条技术路线就是——VLA架构。
也就是把视觉、语言和动作连起来,让机器人从过去只会执行单一动作,进化到能看、能听、能跟着指令干活。
但VLA也有明显局限,它擅长照着做,却很难真正理解复杂物理世界,尤其面对充满随机性的环境时更是招架不住。
更麻烦的是,传统VLA内部很多时候还是「分头干活」的路子。
视觉管看,语言管理解,动作管执行,模块之间数据来回倒腾,每传一次就损耗一次,信息越传越少,以至于机器人在执行时的判断也越来越不准确……
![]()
和传统VLA视觉负责看、语言负责理解、动作负责执行的模块化路线不同,WALL-B选择了一条更底层的融合路径:
那就是消除不同模块之间的信息壁垒,减少数据在模块之间来回传递的损耗。
具体来说就是从底层打通视觉、听觉、语言、触觉与动作,让机器人的感知、理解和执行在同一个网络中协同完成。
在这套架构下,机器人不只是识别眼前物体,还能够结合多模态信息完成空间推理,理解物理规律并预测环境变化,同时保留过去交互中的经验,根据真实反馈不断调整自己的动作策略。
而本次实测直播中,小机器人的一系列临场反应,恰好就是WALL-B这套综合能力的「直接体现」——
基于原生多模态能力,WALL-B能够将看到的画面、感知与执行动作连接起来。
哪怕面对传送带上不断变化的包裹,其也能快速识别感知物体的形状、姿态和位置,理解环境,并直接生成行动。
![]()
此外,基于WALL-B模型能力,机器人还能理解物体背后的物理规律并提前预测不同动作可能带来的结果。
比如在直播中遇到两个包裹叠在一起的突发情况,小机器人能够判断出包裹之间存在遮挡和干扰,直接抓取并不适合,于是临时调整策略,先将包裹分离再逐个完成分拣,忒机智~
![]()
基于「零样本泛化」能力,即使面对此前没有见过的纸箱、软袋或异形件,WALL-B依然可以调用已有的物理认知和操作经验,临场组合出新的处理策略。
从看见包裹,到理解状态和预测变化,再到生成动作,整套流程由WALL-B串成一次完整决策。
也正因为有更强的模型大脑,机器人无需依赖更复杂、更昂贵的硬件堆叠,仅凭更简洁稳定的双臂夹爪方案,也能完成过去需要更高复杂度硬件才能支撑的任务。
![]()
其实对具身智能来说,硬件形态一直存在一个取舍。
人形本体、五指灵巧手等方案,确实能够提供更高自由度,覆盖更多复杂动作,但同时也带来了更高的硬件成本、更复杂的维护要求,以及更长的部署周期。
而随着模型开始承担更多环境理解、任务规划和动作决策的任务,机器人未必需要依靠不断增加硬件复杂度,来解决所有场景问题——
在这场实测直播中,双机械臂搭配工业标准夹爪,省去了利用率相对较低的人形结构和复杂末端执行器,同时也减少了精密关节校准、硬件维护等额外成本。
更重要的是,这套方案可以直接适配现有物流分拣工位,无需大规模改造,就能快速部署到更多仓储场景中。
从过去依靠更复杂硬件拓展机器人能力,到如今通过更强模型提升任务完成能力,WALL-B这次实测也展示了一条更贴近产业落地的具身智能路径。
从家庭到工业,中国具身智能跑出自己的通用路线
能在高难度的直播实测中碾压海外主流玩家,显然不是靠临时给机器人灌输一套现成的物流动作来完成。
真正撑起这场表现的,还有长期扎根真实世界里的「能力积累」。
作为国内较早采用端到端路线研发通用具身智能大模型的公司之一,自变量此前就已经把WALL-B带进真实家庭环境中,让机器人在一次次真实交互里持续学习和迭代。
而家庭,恰恰是机器人泛化能力最难练的试炼场——
这里没有标准答案,家庭物品位置会不断变化,材质和形态难以穷举,家庭成员的需求也不会按照预设脚本出现。
![]()
这些在家庭真实环境中一点点积累起来的经验,也逐渐沉淀为机器人理解复杂世界、适应未知任务的能力底座,并进一步延伸到工业物流等高要求场景。
从家庭服务到物流分拣,同一套模型能力正在跨越差异巨大的应用环境。这意味着,通用具身智能大模型不再局限于针对单一任务进行优化,跨场景泛化也由此成为一个真正可探索的方向。
WALL-B这次从家庭走向工业,并通过模型优势赶超海外头部企业的表现,恰好提供了一个观察这一趋势的窗口。
而这背后,也让整个行业看到了具身智能发展的另一条路径——
未来,随着预训练具身模型持续演进,机器人或许无需围绕每个场景单独开发,而是能够依靠不断增强的模型能力,持续理解新的环境、学习新的任务,并进入更多此前难以覆盖的真实世界。
在这背后,作为国内较早布局通用具身智能大模型的企业之一,自变量已然通过真实场景中的持续验证,探索出这条由模型能力驱动机器人泛化、并走向规模化落地的现实路径。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.