(来源:中国发展网)
转自:中国发展网
中国发展改革报社记者 | 张守营
不久前,北京国家速滑馆“冰丝带”,第二届世界人形机器人运动会闭幕。五天赛程,来自六大洲16个国家的666支参赛队伍、2056台人形机器人“运动员”,围绕51个赛项进行了1301场对决:百米赛道,天工Ultra以8.64秒刷新人形机器人百米纪录,快于人类男子百米的世界纪录9.58秒;原地跳高从首届的0.956米跃升至3.40米;机器人走进工厂搬运上料、走进酒店整理客房、走进商超拣货补货,还走上搏击擂台展开对抗。
赛场的热闹散去,一个更实际的问题浮出水面:这些场面,究竟标志着人形机器人达到了怎样的水平?是真正接近实用,还是仍停留在表演阶段?
回答这个问题,不能只看奖牌榜。业界通常以五层模型衡量具身智能的技术成熟度:VLM(视觉语言模型)司感知,VLN(视觉语言导航)司导航,VLA(视觉语言动作模型)司执行,VLX(视觉语言通用架构)司多任务扩展,WM(世界模型)司对环境规律的预判与规划。五个缩写看似复杂,实则共享同一Transformer技术底座,区别只在输出端——从文字到动作,再到对未来的预测,每进一层,便多一分本领。以此框架逐层检视,这届运动会的成色,可以看得更真切。
感知:看得见,还要看得准
VLM好比给机器人装上“眼睛”,让它看懂画面、理解指令,是后续一切能力的底座。本届运动会上,这层能力呈现出“结构化环境达标、非结构化环境失准”的两面。
田径赛场,感知几乎不构成挑战。百米是固定的直线,400米、1500米也只有弯道,机器人需要“看清”的东西十分有限——跑道线、终点线、自身位置。天工Ultra在这些项目上游刃有余:百米从预赛9.39秒到决赛8.64秒,一路刷新纪录;400米(大型组)以38.15秒夺金;1500米以2分21秒64登顶。支撑这些成绩的,主要是下肢运动控制与步频稳定性,对感知的要求并不高。
一旦转入对抗与开放场景,短板立刻显现。自由搏击擂台上,屡屡出现两名机器人对着空气挥拳踢腿的画面,动作落空率居高不下——视觉系统对高速移动目标的实时跟踪精度不足,对手一动,“眼睛”就跟不上。场景赛同样如此:商超拣货、酒店客房整理,看似简单,实则物品种类繁多、摆放随机、光照多变,对感知精度的要求远高于田径赛道。
从“会跑”到“会干活”,感知是必须跨过的第一道坎。
导航:跑得快,还要走得稳
VLN让机器人听懂语言指令,边观察环境边自主规划路线。这层能力的进步,在本届赛场上有目共睹。
数据最有说服力:400米从首届的1分28秒03提升至本届大型组38.15秒、小型组45.66秒,速度提升接近翻倍;1500米从6分34秒40突破到2分21秒64。天工机器人在长距离赛程中全程保持稳定步频,弯道不倒、直道加速。障碍赛场上,灵犀X2面对狭窄弯道、高低坡道、湿滑路面实时调整路线,摘得100米障碍赛金牌。拔河项目则考验导航的底层功力:不比力气大小,比的是持续拉力之下双脚站得稳不稳、重心把得定不定——赛事方明确表示,这类能力对拖拽、搬运、推拉等作业具有直接参考价值。
但在自由搏击中,导航再度暴露不足。8米见方的擂台不算大,部分机器人被逼至围绳附近便进退失据。动态对抗中的站位调整、步法移动,远比直线奔跑复杂——后者是预设步频的重复运动,前者需要实时感知对手位置并随机应变。
一个耐人寻味的细节是:田径项目的导航已高度自主,搏击项目的攻防移动却仍依赖操作员遥控。同一批机器人,跑百米可以自己跑,打拳却不能自己打。原因不难理解:搏击中的导航不仅涉及“走到哪”,还涉及“边走边躲、边走边找角度”,复杂度上了一个量级。
执行:动得精彩,还要靠得住
VLA让机器人看懂画面、听懂指令后直接输出连续动作,相当于机器人的“手与脚”。这是本届运动会最强的一层,也是中国队伍集中展现硬实力之处。
竞技赛场,动作执行已相当惊艳。原地跳高决赛,天工Ultra系列包揽前四名,冠军成绩3.40米,腾空、落地一气呵成,爆发力与落地控制远超首届。太极拳比赛中,智元远征A3以40.5分夺冠,得分接近亚军的两倍,连贯完成“腾空飞脚接外摆连450度”“外摆连540度接马步”等高难度动作,对全身协调、动态平衡与关节精度的要求极高。自由搏击更集中体现了硬件进步:出拳、扫腿、回旋踢一应俱全,倒地自主恢复能力较首届明显增强——从“一碰即倒、倒地难起”到“被击中后自主起身再战”,是本体硬件与控制算法的双重跨越。
场景赛中的巧手精细操作同样可圈可点。粉末称量、积木搭建等毫米级精度任务,机器人已能稳定完成。智元在作业任务、灵巧手等场景类赛项中夺得13枚金牌,占其18枚金牌总数的七成以上,且参赛机型均为量产标准产品,未作赛事定制。
不过,执行层也有硬伤。自由搏击中动作落空率居高不下,个别机器人电机在高强度对抗中过热失灵;3.40米的跳高固然惊艳,但比赛是单次跳跃,连续作业的稳定性尚未经受检验。执行层的进步,主要体现在单次动作的精度与力度,而长时间、高频次动作的稳定性与可靠性,仍是产业化必须啃下的“硬骨头”。
决策:一专多能,还要自主判断
VLX追求“一套模型覆盖多类任务”,“X”意为“任意、可扩展”。这是衡量机器人是否走向通用的关键一层,也是本届运动会暴露最大短板的一层。
亮点来自通用化方向的初步验证。智元派出的远征A3、精灵G2、灵犀X2与灵巧手OmniHand,参赛项目覆盖田径、体操、武术、作业任务、灵巧手等多个大类:远征A3既能打太极拳夺金,又能出战障碍赛;精灵G2在消防灭火项目中表现出色;灵犀X2兼顾障碍赛与田径。一个型号覆盖多类任务,说明通用化路线正在走通——不再是“跑百米的不会跳高,打拳的不会搬货”。
然而,这一层最核心的要求——端到端自主决策,在对抗项目中暴露无遗。现场解说介绍,每名操控手通过不同按键触发机器人的不同动作模式,“就像F1赛车启动不同程序”;公开报道亦确认,搏击攻防“依然极度依赖熟练操作员通过手柄或遥操作套件进行实时决策”。40公斤级决赛中,华北电力大学参赛队遥控操作宇树科技G1机器人夺冠——人按按钮,机器人出招,并非机器人自主判断该攻还是该守。
这不是某一支队伍的问题,而是行业现状的缩影:结构化环境中能自主,非结构化对抗中靠人工。跑步可以自主,因为那是预设步频的重复运动;搏击难以自主,因为攻防需要完成实时感知、判断、选择的完整闭环。从“遥控触发预设动作”到“端到端自主感知决策行动”,中间还差关键一跃。
前瞻:预判未来,先补数据
WM即世界模型,让机器人在内部推演“如果我这样做,接下来会发生什么”,从而预判与规划。这是五层中的最高一层,也是本届运动会上近乎空白的一层。
仍以自由搏击为例。如今的机器人是纯“反应式”的——看到什么做什么,遥控让做什么就做什么,不会预判对手下一步如何出招、自己这一步会招致怎样的反击。人类高手搏击,靠的是读肩、读重心、读步法,出拳之前已在头脑中预演了后续数步攻防。这一层,目前还是一片空白。
世界模型之所以空白,深层原因在于数据匮乏。世界模型需要海量真实场景交互数据来学习“动作—后果”的映射规律,仅靠实验室采集远远不够。
正因如此,闭幕式上发布的一项成果,比金牌榜更值得关注:赛迪研究院、北奥集团联合北京人形机器人创新中心、上海智元、银河通用、万境千寻、星海图等机构和企业,共同发布全球首个世界级人形机器人运动会全量数据集——总时长超过2500小时,覆盖工业、商超、餐饮、办公、家庭、消防救援、酒店、图书馆、园林、新能源汽车充电等12个应用场景,包含44项作业、百余项技能、万余项精细化任务,并向社会免费开放。
这不只是赛后总结,更是产业基础设施。有了2500小时真实场景操作数据,研究机构与企业训练世界模型时便不必从零采集,真机数据获取成本将显著降低。世界模型这一层眼下是空白,但数据集的开放,等于在空白处打开了一扇门。
回到开头的问题:这届运动会展现了什么水平?五层模型给出的答案颇为清晰——执行层全球领先,感知层、导航层在结构化环境中达标、在非结构化环境中仍有差距,扩展层刚刚起步、自主决策能力不足,融合层近乎空白。16个国家参赛固然是事实,但从决赛阵容看,多个竞技项目的奖牌争夺主要在中国队伍之间进行,高动态对抗领域尚缺乏有分量的国际竞争者。今年上半年我国人形机器人出货量超4万台、全球占比97%,产业规模领先毋庸置疑,但出货量与智能水平并不能画等号,规模优势不会自动转化为能力优势。
真正值得记取的,是两个变化。其一,从首届到第二届的跨越:上届倒地难起、起身靠人,这届被击中后自主起身、百米8.64秒、跳高3.40米,硬件与控制算法的进步肉眼可见。其二,从奖牌到基础设施的转变:组委会没有把数据攥在手里,而是将2500小时真实场景数据免费开放给全行业。赛场夺牌是短期看点,数据开放是长期利好——后者决定着世界模型的空白能以多快的速度被填补。
五层模型,从感知到融合,每一层都对应一道产业考题。这一届答好了执行层,决策与世界模型的“答卷”还空着。但至少,“笔”已经递到了手上。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.