![]()
导语:从波士顿动力那只踉踉跄跄的BigDog,到今天能后空翻、能跑酷的人形机器人,腿足机器人在过去十年间经历了一场惊人的进化。如今,四足机器人已进入商业化阶段,人形机器人的量产计划排上了2026年的日程。但当硬件不再是瓶颈、走路不再是难题,这个领域的下一个挑战是什么?答案或许出人意料:不是更快的腿,而是更聪明的眼睛。2026年7月,一篇发表于《Science Robotics》的综述长文,系统梳理了腿足机器人的进展、挑战与未来,揭示了这条赛道背后的技术逻辑和深层张力。
一、硬件:一场“由硬到软”的民主化革命
腿足机器人硬件的最大转折点,在于驱动方式的根本变革。
早期的腿足机器人靠液压驱动——波士顿动力Atlas和BigDog就是典型。液压系统功率密度高,但机械复杂、造价昂贵、维护困难,还会漏油。这条路很难规模化。与此同时,传统电机又面临一个两难:高速高效,但扭矩不足,必须加大幅减速齿轮。高减速比带来了摩擦和阻抗,让关节变得僵硬,无法顺应地面冲击。
真正的突破来自一个看似简单的思路转变:用定制的高扭矩密度电机,配上极低的减速比传动。这种方案让关节高度透明、可反向驱动——电机转子和输出端之间几乎没有机械阻隔。关节扭矩可以通过电机电流直接估算,无需额外的力矩传感器。这意味着高频、高精度的力控变得极其简单。
更重要的是,这一设计理念被开源了。MIT Cheetah和Mini Cheetah的电机设计公开后,整个领域出现了大量基于相同原理的四足和人形机器人平台——从宇树的四足和H系列,到UCLA的ARTEMIS人形机器人。硬件的民主化,是腿足机器人从实验室走向产业化的第一推动力。
传感器的小型化也在同步推进。本体感觉传感器(关节编码器、IMU惯性测量单元)和外部感知传感器(激光雷达、深度相机)的集成,让机器人不仅能感知自身姿态,还能实时重建地形几何,规划落脚点。但一个关键短板依然存在:触觉皮肤。分布式触觉可以感知碰撞、滑移和接触力,但其耐用性和集成难度至今仍阻碍着大规模部署。
一个值得关注的趋势是,替代驱动技术(人工肌肉、肌腱驱动)和软体结构正在萌芽。它们可能带来更好的安全性和人机交互性,但目前仍受限于制造、耐用性和控制难题,尚不具备商业可行性。
![]()
二、运动控制:仿真训练出来的“肌肉记忆”
硬件能动了,怎么让它走得稳、跑得快,还能跳过障碍?答案藏在仿真里。
腿足机器人运动控制领域过去十年的最大变革,是强化学习在仿真中的大规模应用。核心逻辑是:在GPU加速的物理仿真器中并行运行成千上万个机器人副本,每个都在不断试错、优化自己的行走策略,最终训练出一个足以零样本迁移到真实硬件的策略网络。
这里有一个关键的设计选择:策略网络通常输出关节位置目标,而非直接扭矩指令。位置指令通过底层阻抗控制转化为扭矩——这套“位置→扭矩”的转换,在训练阶段大大降低了策略的探索难度,是强化学习能在腿足机器人上如此成功的隐性功臣。
![]()
仿真到现实(Sim-to-Real)的迁移技术是另一个关键推手。系统辨识让模型精确匹配特定机器人的动力学参数,域随机化则让策略在训练阶段就暴露于大量参数变化中,学会对不确定性保持鲁棒性。更高级的做法是域自适应——机器人边跑边在线估算环境参数,实时调整策略。这解释了为什么今天的腿足机器人能在草地、雪地、湿滑路面等完全不同的地面上稳定行走。
但现在,瓶颈正在从“能走”转向“能看”。
传统运动控制器主要依赖本体感觉和几何感知(地形高度图),这在平坦和不连续地形上已经表现不错。但当面对松动的石头、容易折断的树枝、需要绕过的障碍这类需要“理解”而非仅仅是“看到”的地形时,纯几何信息就不够用了。
这篇综述提出了一个新的研究范式——“灵巧语义运动”。核心思想是:机器人不能只看到地形形状,还要像人类一样解读环境线索。人走路时不是精确计算每一步的落脚点,而是自动避开不稳定的碎石、预判潮湿路面的摩擦力、绕过无法踏足的区域。这种能力依赖对环境的语义理解——知道“这是什么”,而不只是“这长什么样”。
实现这一范式,需要视觉和语义的结合。早期已有工作让机器人仅凭RGB图像预测环境的“可穿越性”,而非显式重建三维地图;还有系统将大语言模型的常识推理用于机器人导航规划。这些尝试指向一个共同的趋势:让腿足机器人从“几何感知”走向“语义理解”,从被动响应走向主动预判。
三、自主性:模块化的终结,还是新范式的萌芽?
传统自主导航系统是一套严格的分层流水线:感知模块重建地形地图,规划模块计算最优路径,控制模块执行运动。每个模块有明确定义的输入输出接口。
![]()
这套架构的问题在于,它在复杂环境中太脆弱了。一个典型的例子是机器人跑酷——需要越过缝隙、跨过高台、钻过低矮障碍。在这些场景中,规划和运动不能是割裂的两步:你选择哪条路径直接取决于你能否跨过那个障碍,而你能否跨过去又取决于你的运动能力和当时的动态状态。层级解耦的架构无法处理这种紧密耦合。
最近的研究开始探索两种替代路径。一是将强化学习同时用于导航和运动控制,让策略直接从传感器输入端到端输出动作。二是将语言抽象融入自主系统——让机器人不仅理解环境几何,还能理解“绕过倒下的树”和“穿过门”这样的高层语义指令。使用场景图等记忆结构来存储和检索这些语义信息,让导航系统具备了更接近人类的常识推理能力。
但两种路线各有短板。端到端学习导航虽然在灵巧性上有优势,但在可解释性和鲁棒性上仍落后于经典方法。更重要的是,当前模仿学习导航策略难以有效整合本体感觉信息——它们“看”得不错,但“感受”不到自己的运动状态。而依赖基础模型的方法虽然泛化能力强,训练成本高昂且难以应对硬实时控制需求。
模块化系统是否真的要被淘汰?这个问题尚无定论。一个更有前景的方向可能是:保留底层控制对确定性、实时性和鲁棒性的严格要求,而在高层规划、场景理解和语义推理上引入学习方法的灵活性。模块之间的接口不必是硬编码的,而是自适应的、可学习的。
四、数据:仿真和现实之间,还差一条鸿沟
腿足机器人的数据困境比自动驾驶更棘手。
![]()
自动驾驶汽车每天在路上跑,天然积累海量数据。但腿足机器人需要的是在复杂非结构化地形上的部署数据——森林里的树根、建筑工地的碎石、洞穴里的岩石——这些场景不仅部署成本高,而且环境极度多变。
目前的应对策略是两层互补。仿真负责大规模生成训练样本,是目前运动控制和底层导航的主要数据来源。但仿真有明确的局限:植物缠绕脚踝、松软泥土的下陷、狭窄环境中的身体挤压——这些复杂物理交互,当前的刚体仿真器根本无法准确模拟。而且,生成高保真RGB视觉数据需要巨大的GPU资源,而即便是最好的视觉仿真,也仍然与现实存在肉眼可见的差距。
真实世界数据则极度稀缺且昂贵。目前最大的四足机器人导航数据集(GrandTour、Sub-T)覆盖了从城市街道到森林、从不同光照到不同天气的场景,但规模和多样性仍远不及自动驾驶领域。一个关键瓶颈是:采集数据的机器人本身就是稀缺资源。自动驾驶公司可以部署数百辆测试车,但腿足机器人研究团队往往只有寥寥几台样机。
更深远的问题在于领域共识的缺失。腿足机器人领域缺乏标准化基准和共享实践。大多数Sim-to-Real研究依赖定制硬件,难以系统化比较。模拟环境的比较也有局限,因为它们无法反映将策略迁移到真实硬件上的真实挑战。
未来的出路可能在于三层协同。神经渲染技术有望在仿真中生成更逼真的RGB数据,神经增强物理引擎则能更好地模拟复杂接触和软体交互。与此同时,腿足机器人的更广泛部署(即使初期依赖人工遥控操作)将自然扩展真实世界数据规模。把可扩展仿真、生成式数据增强和广泛实际部署结合起来,或许能最终形成数据飞轮——让数据驱动性能提升,性能提升反过来推动更广泛的部署,从而产生更多数据。
五、现实应用:从“能走”到“能干”的跨越
目前腿足机器人的商业化主要集中在三个领域。
巡检与监控是四足平台最先落地的场景。ANYbotics的ANYmal被部署在海上油气设施,波士顿动力Spot进入了矿山、能源设施,甚至核电站。这些场景的共同特点是:地形复杂(楼梯、格栅、管道),环境危险,但任务相对标准化。
末端配送是另一个正在验证的商业方向。RIVR等公司已经演示了包裹和食品的真实上门配送,在城市环境中通过远程操作和共享自动驾驶结合的方式实现了面包车到门口的全流程。
2022年开始的“人形热潮”则将目标锁定在更宏大的应用场景——制造业和家庭服务。商业试点人形机器人计划在2026年前进入私人家庭执行简单任务,多家公司正在进行或计划量产。但这里有一个值得关注的悖论:平坦工厂里的人形机器人其实并不需要先进的移动能力。研究者指出,这些部署的真正价值或许不在于“能走”,而在于它们代表了通向通用机器人的第一步——利用规模经济和大规模生产来驱动成本下降和数据积累,即使最初的应用场景看起来“反直觉”。
在更前沿的领域,腿足机器人正在成为科学探索的工具——从森林生态监测和土壤采样,到野生动物行为观察。欧洲航天局的空间资源挑战赛已将四足平台纳入洞穴和陨石坑探索的候选方案。但热管理、能源管理和长期可靠性,仍是地外部署需要跨越的硬门槛。
![]()
六、伦理与政策:当机器人大规模走进人间
经济影响可能是最迫切的议题。腿足机器人与工业机器人有一个关键区别:后者主要影响制造业(约占发达国家劳动力7.5%),而腿足机器人有能力进入服务业——这个占发达国家劳动力约80%的庞大市场。据估计,美国47%的就业面临高自动化风险。每千名工人多一台工业机器人,工资下降0.42%——这个数字在服务业可能更高,因为替代效应不再局限于特定行业。
监管也面临全球性分歧。欧盟AI法案按风险等级分类,对高风险应用实施严格合规要求。日本Society 5.0则采取积极推广立场,将机器人视为应对老龄化社会的解决方案。中国通过产业政策和明确目标推动人形机器人大规模生产。美国则缺乏全面立法,主要依赖行业指导方针。这些差异可能产生实质性的经济影响:中国工业机器人密度已达每万名员工470台,超过德国和日本,亚洲与西方平台之间已出现显著价格差异。
更隐蔽的是伦理问题。有腿机器人因其形态与人类或动物的相似性,在几个层面上不同于其他机器人。一是它们更容易激发用户的情感依附——当一只机器狗被踢时,旁观者的反应和看到扫地机器人被踢时截然不同。二是它们的性别和种族表征具有更深层的象征意义。历史上机器人曾被种族编码为“机械奴隶”,而当代人形机器人几乎总是呈现白色或闪亮金属外表——这种视觉选择不是中性的。三是为老年人设计护理机器人的“人口危机”叙事,绕开了一个根本问题:老年人是否真的愿意被机器人照顾?机器人提供的“关怀”能否满足社交和情感需求?
腿足机器人在军事领域的部署则引发了更尖锐的问责问题。它们可能扩大机器人在战争中可承担的角色范围,批评者担心这会降低冲突门槛,使责任分配变得困难,并侵犯敌方战斗人员的人权。这也是为什么综述作者呼吁国际协调——尤其是针对致命自主机器人——必须提上日程。
七、结语:当腿不再是瓶颈,什么决定了未来?
这篇综述最核心的洞察,或许在于它揭示了腿足机器人当前所处的历史节点。
硬件已进入商品化阶段,运动控制已基本解决平坦地形问题。四足机器人已有成熟产品,人形机器人正在批量生产。但语义理解、灵巧操作和通用自主性仍是远未攻克的前沿。
一个意味深长的发现是:强化学习让“走路”成为可以靠仿真训练解决的问题,但“知道往哪走”和“走得聪明”——避开不稳定的碎石、绕过无法踏足的区域、理解“这里太滑不能踩”——这些需要比几何感知更深层的环境理解,而目前的技术手段还远不足以覆盖现实世界的复杂性和不确定性。
综述作者团队在文末提出了一个明确的行动框架:基于能力的监管应随机器人能力升级而动态调整(纯行走只需极低监管,社交互动则需要较高监管);国际协调需要优先应对致命自主武器的风险;战略性产业政策不能是简单的保护主义,而应是研发投入、制造基础设施和技能发展的综合布局;前瞻性劳动力转型需要在各能力层次识别和培养与机器人互补的人类技能——从车队管理和技术支持,到机器人与人类团队的协调组织。
当机器人学会走路、学会观察、学会真实世界中自主行动,我们的社会能否同步学会如何与它们共存?这个问题,可能比技术本身更需要迫切地回答。
本文由CAAI认知系统与信息处理专委会供稿
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.