网易首页 > 网易号 > 正文 申请入驻

IROS 混合LMC:通过集成深度强化学习实现轮式仿人机器人的混合学习和基于模型的控制

0
分享至

引用: Baek D, Purushottam A, Ramos J. Hybrid lmc: Hybrid learning and model-based control for wheeled humanoid robot via ensemble deep reinforcement learning[C]//2022 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). IEEE, 2022: 9347-9354.

PART. 0 0 文章信息

作者单位:

Department of Mechanical Science and Engineering

Department of Electrical and Computer Engineering at the University of Illinois at Urbana-Champaign

文章链接: https://ieeexplore.ieee.org/document/9981913

DOI: 10.1109/IROS47612.2022.9981913

PART. 0 1 摘要

由于这些机器人的非线性动力学和欠驱动特性,轮式人形运动的控制是一个具有挑战性的问题。传统上,反馈控制器用于稳定和运动。然而,这些方法往往受到所使用的底层模型的保真度、控制器的选择和所考虑的环境变量(表面类型、地面倾角等)的限制。强化学习(RL)的最新进展为解决这些传统的反馈控制问题提供了有前景的方法,但需要大量的交互数据来学习。在这里,我们提出了一种混合学习和基于模型的控制器混合LMC,它结合了经典线性二次型调节器(LQR)和集成深度强化学习的优点。集成深度强化学习由多个软行动者批评(SAC)组成,用于降低RL网络的方差。通过串联使用反馈控制器,网络在训练的早期阶段表现出稳定的性能。作为第一步,我们在MuJoCo模拟器中探索了混合LMC在一组不同物理参数下控制人形机器人轮式运动的可行性。我们的结果表明,与其他现有技术相比,混合LMC的性能更好,样品效率也更高。

PART.02背景与方法

人形机器人有可能帮助工人完成体力要求高和危险的工作,如打架和救灾[1],[2]。为了帮助完成这些任务,人形机器人必须能够操纵和运动。同时对间歇性接触和干扰具有鲁棒性。轮式人类机器人(WHR)正成为完成这些任务的有前景的平台,将移动机器人的优势与腿式机器人的灵巧性相结合[3],[4]。

然而,固有的不稳定性、非线性、不精确的建模误差和强耦合机制对WHR的控制提出了挑战。具体来说,WHR的平衡控制对于机器人在现实世界中穿越各种集群阵列至关重要。

对于这些高维非线性系统,最常见的控制方法是使用降阶模型(RoM)对机器人进行建模,如线性倒立摆(LIP)和轮式倒立摆(WlP),并采用基于模型的线性二次型调节器(LQR)[5]、[6]或模型预测控制(MPC)[7]。或者,利用微分动态规划(DDP)和非线性PC(NMPC)作为非线性方法生成全身运动[8],[9]。尽管它们在机器人社区中得到了广泛的应用,但这些控制器的稳定性和鲁棒性受到机器人模型和周围环境保真度的限制。此外,这些方法的性能取决于具有固有误差的模型的准确性。

基于深度强化学习(RL)的方法最近作为一种新兴的解决方案引起了越来越多的关注,并显示出解决高度非线性运动问题的成功[10],[11],[12]。他们可以通过直接从经验中学习策略并自动调整控制器来优化表示任务的给定阻力(或成本)函数,从而克服先前基于模型的自适应方法的局限性。然而,标准的强化学习方法需要机器人和环境之间长时间的交互来学习复杂的技能,这在最初可能是不安全的。收集学习复杂任务所需的数据量是耗时的。尽管提出了许多模拟到真实的技术[12]、[13]、[14],但缩小模拟和现实之间的领域差距仍然具有挑战性,需要花费大量时间(长达几天)进行训练。在特殊情况下,仅通过RL控制WHR是具有挑战性的,因为它们在探索的初始阶段本质上是不稳定的,每次重新设置机器人都是非常低效和有风险的。

同时,将归纳偏差或先验知识(如分析模型、传统控制器)与RL相结合,旨在通过提高采样效率和减少状态空间体积来帮助更安全、更快地探索RL策略,从而解决传统控制器和基于RL的方法的问题[15]、[16]、[17]。尽管这种方法在操作和导航任务中显示出了令人印象深刻的结果[15]、[6],但对于高维的运动来说,它尚未被证明需要收集与任务相关的数据。具体来说,WHR的大多数控制器直接从命令映射到结果扭矩,而不使用高级轨迹或学习策略,这使得解决运动问题更具挑战性。

考虑到这一点,本文的目标是通过从相对稳定的控制器开始探索,并有效减少控制部分的残余误差,为WHR开发一种混合控制器,以补充RL和基于模型的控制器。

在这项工作中,提出了一种结合最优控制器和插入式深度强化学习的混合学习和基于模型的控制器(混合LMC),通过减少非线性、建模误差和各种环境变化引起的残差来提高运动控制性能。基本概念与残差强化学习相同[15],但与之前的工作不同,我们利用了ensembleRL策略,该策略利用了多个软行为者批评者(SAC)[18]和最优控制器(OR)提供的分配动作扭矩,通过更广泛的低方差探索更仔细地选择补偿扭矩。我们的方法允许产生与现有工作相反的扭矩,现有工作使用策略网络来构建高级命令,如轨迹信号。

这项工作的贡献如下:(1)提出了混合学习和基于模型的控制器,利用基于模型控制器和深度强化学习的优点来提高轮腿类人机器人的控制性能。据我们所知,这是首次将残差RL等组合策略应用于类人运动。(2) 实验结果表明,混合线性矩阵控制优于残差强化学习和无模型强化学习算法,即使在各种物理参数发生变化的情况下,也能补偿LOR控制器的残差。(3) 进行了烧蚀研究和其他实验,以有效研究混合LMCutilizing,并进行了仔细分析。(4)使用人体数据的实验结果表明了混合LMC应用于遥操作系统的可行性。

PART.04实验

PART.05总结

在本文中,我们提出了一种混合学习和基于模型的控制器——混合LMC,它结合了传统基于模型的LOR和深度强化学习的优点,在存在模型不确定性和参数变化的情况下进行更稳健的跟踪。此外,集成强化方法可以提高标准控制器的性能,同时降低单个基于随机的RL策略的方差。通过这种方式,我们能够直接进行端到端的学习。通过结合组件深度RL和LOR控制器,LQR引导RL策略在充足范围内产生更合适的扭矩,从而提高了采样效率。对消融研究进行了仔细的研究和分析,以提供一种使用混合LMC的正确方法。在所有实验中,混合LMC都优于之前的方法,并在模型变化和不规则期望轨迹的情况下表现出普遍的性能改进。

在未来的工作中,我们将在硬件上将混合LMC应用于轮式人形机器人系统SATYRR,以验证混合LMC在物理世界中的性能。基于我们的结果,我们希望混合线性矩阵控制在提高性能的同时,为安全训练真实系统提供了一种有效的方法。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“4岁男童被指摸臀”父亲发声:已第一时间道歉,相信法律会给出公正的判断

“4岁男童被指摸臀”父亲发声:已第一时间道歉,相信法律会给出公正的判断

潇湘晨报
2026-09-09 12:22:10
成都航空一航班滑行阶段2名乘客起冲突动手,目击者:因调座椅引发口角并演化为肢体冲突,经停时双方被带离调查致航班延误

成都航空一航班滑行阶段2名乘客起冲突动手,目击者:因调座椅引发口角并演化为肢体冲突,经停时双方被带离调查致航班延误

扬子晚报
2026-09-09 07:52:59
山西省原省长金湘军一审被判死缓:受贿1.48亿,已认罪悔罪

山西省原省长金湘军一审被判死缓:受贿1.48亿,已认罪悔罪

界面新闻
2026-09-08 17:28:38
我国著名地理学家、华东师范大学终身教授许世远逝世,享年89岁

我国著名地理学家、华东师范大学终身教授许世远逝世,享年89岁

界面新闻
2026-09-09 08:22:54
71岁香港知名女星突然“被结婚”,74岁低调老戏骨无辜变新郎

71岁香港知名女星突然“被结婚”,74岁低调老戏骨无辜变新郎

喜欢历史的阿繁
2026-09-08 18:34:43
WTT澳门冠军赛:大爆冷!国乒遭遇2连败,男单全国冠军2:3一轮游

WTT澳门冠军赛:大爆冷!国乒遭遇2连败,男单全国冠军2:3一轮游

国乒二三事
2026-09-09 12:44:30
“每一个都死气沉沉”,一张军训照片,让家长怒了:我们的孩子为何变成这样?

“每一个都死气沉沉”,一张军训照片,让家长怒了:我们的孩子为何变成这样?

蝴蝶花雨话教育
2026-09-09 00:05:15
快快帮|专技岗按50周岁“一刀切”退休?扬州宝应小天使幼儿园门诊部:管理疏忽,承诺纠正

快快帮|专技岗按50周岁“一刀切”退休?扬州宝应小天使幼儿园门诊部:管理疏忽,承诺纠正

现代快报
2026-09-08 17:45:08
女子和情人车震后被杀,丈夫找一夜未果,2024年情人:杀她是她想提出分手

女子和情人车震后被杀,丈夫找一夜未果,2024年情人:杀她是她想提出分手

汉史趣闻
2026-09-09 11:02:17
余承东:技术远远超过特斯拉,微博CEO:亲测,实在太强了,网友:又沾沾自喜了

余承东:技术远远超过特斯拉,微博CEO:亲测,实在太强了,网友:又沾沾自喜了

大厂财经社
2026-09-09 11:09:59
性专家直言:男人老得快,多半是丢了这三样东西

性专家直言:男人老得快,多半是丢了这三样东西

鬼菜生活
2026-09-07 11:51:40
15亿欧皇马挥霍7次机会!穆帅怒批群星:6-1踢成2-1 我不喜欢 失控

15亿欧皇马挥霍7次机会!穆帅怒批群星:6-1踢成2-1 我不喜欢 失控

风过乡
2026-09-09 09:26:02
“卤米松”原研药从30元涨到800元!厂家:原料供应商变更致断货,可更换其他药品

“卤米松”原研药从30元涨到800元!厂家:原料供应商变更致断货,可更换其他药品

红星资本局
2026-09-08 18:53:05
创造历史!17岁高中生破格入选国足,身高1米94,父母身份不简单

创造历史!17岁高中生破格入选国足,身高1米94,父母身份不简单

阿讯说天下
2026-09-09 10:26:22
近几天,很多上海人收到了一条短信!事关这笔钱和保障!重要提醒:这是真的→

近几天,很多上海人收到了一条短信!事关这笔钱和保障!重要提醒:这是真的→

上观新闻
2026-09-09 11:35:29
网传北京社保基数已经涨不动了,评论区炸锅…

网传北京社保基数已经涨不动了,评论区炸锅…

慧翔百科
2026-09-09 11:23:54
坚决支持中国政府的严正声明,西沙群岛属于中国,毫无争议,中方在西沙建设是在本国自家院子里完善生活圈,他国没资格说三道四!

坚决支持中国政府的严正声明,西沙群岛属于中国,毫无争议,中方在西沙建设是在本国自家院子里完善生活圈,他国没资格说三道四!

扶苏聊历史
2026-09-09 09:21:09
不查不知道,一查吓一跳,身价上亿的郭德纲,私下的生活壕到离谱

不查不知道,一查吓一跳,身价上亿的郭德纲,私下的生活壕到离谱

一些小事
2026-09-09 08:59:44
香港首任特首董建华逝世,享年89岁

香港首任特首董建华逝世,享年89岁

观察者网
2026-09-09 07:57:03
吴秀波案件翻版!深圳投资圈大案,90后“小三”为半百老男多次流产获刑14年,网友:这是有钱人,白嫖穷人家的女儿吗

吴秀波案件翻版!深圳投资圈大案,90后“小三”为半百老男多次流产获刑14年,网友:这是有钱人,白嫖穷人家的女儿吗

火山詩话
2026-09-08 13:16:44
2026-09-09 16:12:49
算法与数学之美 incentive-icons
算法与数学之美
分享知识,交流思想
5752文章数 64626关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

卡德罗夫:俄乌冲突爆发以来 车臣共和国派出超7.6万人

头条要闻

卡德罗夫:俄乌冲突爆发以来 车臣共和国派出超7.6万人

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭麒麟最便宜贵公子争议,本人未回应

财经要闻

8月CPI同比涨0.8% PPI环比由降转涨

汽车要闻

魏牌全新蓝山申报信息曝光 方盒子造型 5/6座可选

态度原创

本地
健康
时尚
游戏
公开课

本地新闻

宁波,中国制造的隐藏大佬

中风康复为何像“抽丝剥茧”?

恭喜这位女士,把对手打哭,重回巅峰

《塞尔达传说时之笛重制版》发售日、售价、玩法改进等情报公布

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版