网易首页 > 网易号 > 正文 申请入驻

DeepMind:乒乓球agent的一小拍,自主学习机器人的一大步

0
分享至

原文作者:

Pannag Sanketi,Google DeepMind 机器人团队高级工程师兼技术主管。

Heni Ben Amor,亚利桑那州立大学副教授,互动机器人实验室主管。

几乎每天,全球各地的学术实验室或商业公司都在发布令人瞩目的新型机器人平台。特别是在人形机器人领域,它们协助工厂作业的能力正日益增强,并有望最终拓展至家庭和医院等场景。然而,要让这些机器人真正具备实用价值,它们必须拥有复杂的“大脑”来精确控制其物理躯体。

传统上,为使机器人达到预期的性能表现,专家需要投入大量时间编写程序,精心设计复杂的行为脚本,并细致且反复地调整参数(如控制器增益或运动规划权重)。尽管机器学习(ML)技术展现出很大的潜力,但要让机器人学习全新的复杂行为,目前仍普遍需要大量的人工监督和系统性再设计。

在 Google DeepMind,我们一直在思考一个核心问题:如何让机器人实现更全面、更持续的学习与适应能力,从而在每次取得重大性能提升或掌握新技能时,减少对专家干预的依赖?

这一思考始终是我们机器人研究的核心驱动力。我们正在探索一种新的研究范式:让两个机器人智能体(agent)在相互对抗的环境中,达到更高的自主性,实现自我提升。这种范式旨在超越那些仅可以执行预先编程的固定任务或适应性有限的机器学习模型,转而训练出能够在实际操作中学习广泛技能的 agent。

基于我们在机器学习领域的前期工作,例如 AlphaGo 和 AlphaFold 项目,我们将目光聚焦在了乒乓球这项高难度运动上,将其作为理想的测试平台。

我们之所以选择乒乓球,是因为这项运动在一个相对受限但同时又高度动态的环境中,体现了机器人技术所面临的最严峻挑战。

要打好乒乓球,机器人必须掌握多种复杂技能:除了需要敏锐的感知能力外,还必须具备极高的精准控制力,从而以恰当的角度和速度拦截对方来球,并通过巧妙的战略决策来战胜对手。这些要素共同使得乒乓球成为开发与评估学习算法的绝佳领域——这些算法需要能够处理实时交互、复杂的物理计算、高级推理,并制定出适应性强的策略。

而这些能力,不仅可直接应用于制造业等场景,甚至可能在未来适用于非结构化的家庭环境。

自我提升挑战

传统的机器学习方法很难实现持续、自主的学习。以模仿学习为例,机器人通过模仿专家行为来学习,通常要求为每一项技能或其变体提供大量的人类演示数据;如果我们想让机器人持续学习新任务或随着时间的推移不断提升性能,这种对专家数据收集的依赖便会成为一个瓶颈。

同样地,强化学习通过奖励或惩罚来引导 agent 进行试错训练,但这通常需要人类设计师精心设计复杂的数学奖励函数,从而精确捕捉多维任务中的预期行为,且这些函数还需要随着机器人需要提升或学习新技能而进行调整,这无疑限制了其可扩展性。

从本质上讲,这两种成熟的机器学习方法都涉及大量的人类参与,尤其是在目标设定为让机器人在初始编程之后仍能持续自我提升的情况下。

因此,我们提出了一个直接的挑战:机器人是否能够在学习与提升的循环中,以极少甚至无需人类干预的方式,自主地学习并提升其技能?

在竞争中学习:机器人vs.机器人

我们探索的一种创新方法借鉴了 AlphaGo 的策略:让 agent 通过与自身竞争来学习。我们尝试让两台机器人手臂进行乒乓球对决,这个想法虽然简单,却非常有效。当其中一台机器人发现更优策略时,其对手被迫随之适应并提升自身能力,从而形成一个技能水平持续提升的循环。

为了支撑这种学习范式所需的大规模训练,我们设计了一个完全自主的乒乓球环境。该系统可以持续运行,具备自动球收集的功能,并支持远程监控与控制,这使得我们能够在无需人工干预的情况下进行长时间的实验。

作为第一步,我们通过强化学习在模拟环境中成功训练了一个机器人 agent,并将其和复制版本部署在两个机器人上,使它们能够进行合作式对打。随后,我们在真实的机器人对战环境中对 agent 进行了数小时的微调,最终获得了一种能够维持长时间对打的策略。接着,我们将研究重点转向了竞争性的机器人对战问题。

在竞争性对战中,原本的合作式 agent 表现并不理想。这其实是可以预料的,因为在合作对打阶段,球的来回通常会稳定在一个相对狭窄的区域,这限制了 agent 能够击回的球的分布范围。

我们的假设是,如果继续在竞争性环境中进行训练,并且奖励每个机器人击败对手的行为,那么这种球的分布范围会逐渐扩大。尽管前景看起来不错,但在现实世界中通过竞争性自我对战来训练系统面临着挑战。由于模型规模的限制,分布范围的扩大实际上相当严重。

本质上,模型在有效学习新击球方式的同时,难以避免地会遗忘旧的击球方式,并且在训练过程中迅速陷入了局部最优解:短暂的对决之后,一台机器人会打出对手难以回击的制胜球,而另一台机器人则束手无策。

尽管机器人间的竞争性对战仍然是一个重大难题,我们的团队同时也探索了机器人如何与人类进行竞争性对战。在训练初期,人类玩家通常更擅长保持球在场内,这增加了机器人可以学习的击球分布范围。我们仍然需要开发一种策略架构,其应该包括具有详细技能描述的低级控制器和负责选择低级技能的高级控制器,以及支持从模拟到现实零样本迁移的技术,从而使系统能够实时适应未曾遇到过的对手。

在用户研究中,尽管机器人在与人类顶尖玩家的对决中全部落败,但它在与初学者的对决中全部获胜,并在与中级玩家的对决中取得了约 50% 的胜率,这显示出其具备了相对稳定的业余人类水平。

凭借这些创新,再加上相比合作模式更优越的起点,我们已经处于一个有利的位置,可以重新聚焦于机器人间的竞争性训练,并继续推动系统的快速扩展。

详情查看:

当VLM成为AI教练

我们探索的另一个有趣思路是:视觉语言模型(VLM)是否能够扮演教练的角色,观察机器人的表现并提供改进建议?

该项目的一个关键洞见在于,VLM 可以用于实现可解释的机器人策略搜索。基于这一洞见,我们开发了SAS Prompt(即 summarize 总结、analyze 分析、synthesize 合成)方法,其能够利用 VLM 的检索、推理和优化能力,通过迭代学习与适应机器人的行为,最终合成新的行为模式。我们的方法可以看作是一种新型可解释策略搜索方法的早期实践,并且搜索完全在 LLM 内部完成。

此外,这种方法无需依赖明确的奖励函数——VLM 能够直接根据任务描述中的观察结果来推断奖励。

因此,VLM 可以作为教练,持续分析“学生”(即机器人)的表现,并提供相应的改进建议。

迈向真正自主学习的机器人

突破传统编程和机器学习技术的局限性,对于机器人技术的未来发展至关重要。我们正在研究的方法,其目标正是减少对繁琐人类工作的依赖。我们的乒乓球项目,就探索了机器人自主获取并提升复杂技能的途径。

尽管仍面临重大挑战——例如,稳定机器人之间的学习过程,以及扩展基于 VLM 的教练系统——但这些方法无疑提供了独特的机会。我们对此持乐观态度,在这条道路上开展持续研究,将最终带来更强大、适应性更强的机器。这些机器能够学习在我们这个结构复杂的世界中有效且安全运作所需的各种技能。

这条探索之路充满挑战,但真正智能且有益的机器人伙伴所带来的巨大潜力,使得这项研究极具价值,值得我们不懈努力。

https://spectrum.ieee.org/deepmind-table-tennis-robots

翻译:学术君

如需转载或投稿,请直接在公众号内留言

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
建议中老年人:若不差钱,少吃猪肉多吃这8样,高蛋白低脂又美味

建议中老年人:若不差钱,少吃猪肉多吃这8样,高蛋白低脂又美味

美食店主
2026-09-09 00:27:04
美国邮政新规:50英里外邮局停收,数万选民选票悬了!

美国邮政新规:50英里外邮局停收,数万选民选票悬了!

流年恰似繁花汐
2026-10-03 19:02:28
秋天这种“黄金果”被抢疯了,维生素C是苹果的60倍,但90%的人吃错了

秋天这种“黄金果”被抢疯了,维生素C是苹果的60倍,但90%的人吃错了

富贵说
2026-10-02 11:53:37
颠覆认知!美国用核聚变技术钻井,不用钻头飙到5米/小时

颠覆认知!美国用核聚变技术钻井,不用钻头飙到5米/小时

徐德文科学频道
2026-10-01 15:55:54
宁夏回族自治区政府主席张雨浦,不打招呼、突击调度、随机抽查

宁夏回族自治区政府主席张雨浦,不打招呼、突击调度、随机抽查

新京报
2026-10-03 21:15:04
“拿筷子姿势恶心死了!”一段贫民窟小公主吃饭视频,给网友看力竭了!

“拿筷子姿势恶心死了!”一段贫民窟小公主吃饭视频,给网友看力竭了!

林林先生
2026-09-27 10:20:09
为什么无底线善意反而会招来杀身之祸

为什么无底线善意反而会招来杀身之祸

风铃草语
2026-10-03 07:14:12
57岁的金刚狼和他的私人教练

57岁的金刚狼和他的私人教练

粉红冻奶的观影日记
2026-10-03 22:00:17
美国不准对华军售,外媒:中国已跌出全球武器进口国前十名

美国不准对华军售,外媒:中国已跌出全球武器进口国前十名

兵国大事
2026-10-03 00:05:26
“投降的前兆”:专家谈泽连斯基撤离基辅

“投降的前兆”:专家谈泽连斯基撤离基辅

战域笔墨
2026-10-02 15:08:21
《权力的游戏》演员时隔15年现状对比:有人爆红,有人淡出

《权力的游戏》演员时隔15年现状对比:有人爆红,有人淡出

懵面女汉
2026-09-20 11:07:49
伏明霞一家五口参加晚宴,48岁的她完全富婆样,23岁大女儿好漂亮

伏明霞一家五口参加晚宴,48岁的她完全富婆样,23岁大女儿好漂亮

柒佰娱
2026-08-14 11:32:01
马斯克的妹妹从小就坚信,跟着哥哥有肉吃,瞒着妈妈把南非家里的房和车都卖了去加拿大投奔哥哥!妈妈哭笑不得的承认是事实!

马斯克的妹妹从小就坚信,跟着哥哥有肉吃,瞒着妈妈把南非家里的房和车都卖了去加拿大投奔哥哥!妈妈哭笑不得的承认是事实!

大白聊IT
2026-08-14 01:29:05
苹果官宣:部分iPhone 18 Pro Max升级也救不回来,需要进店免费维修

苹果官宣:部分iPhone 18 Pro Max升级也救不回来,需要进店免费维修

小8说科技
2026-10-03 14:47:25
如果中国人的低工资是一种优势,那谁最希望我们永远低工资?

如果中国人的低工资是一种优势,那谁最希望我们永远低工资?

熊倌儿
2026-09-19 10:48:32
浙江27岁女子花6万相亲,多次被介绍四五十岁男子!婚介公司:她要求对方收入200多万

浙江27岁女子花6万相亲,多次被介绍四五十岁男子!婚介公司:她要求对方收入200多万

FM93浙江交通之声
2025-10-27 17:22:07
48岁李小冉俯拍写真火了!敢穿敢露,这状态谁看了不迷糊?

48岁李小冉俯拍写真火了!敢穿敢露,这状态谁看了不迷糊?

手工制作阿歼
2026-10-03 00:44:10
亚运跳水比赛刚收官,央媒“点名”陈芋汐,郭晶晶当年的话说对了

亚运跳水比赛刚收官,央媒“点名”陈芋汐,郭晶晶当年的话说对了

铜臭的历史味
2026-10-04 03:38:13
一言不合就是床戏,Netflix爆款终于回归

一言不合就是床戏,Netflix爆款终于回归

来看美剧
2026-10-03 22:42:22
阿联酋检方:迪拜航空涉事副驾驶使用消防斧实施“恐怖袭击”

阿联酋检方:迪拜航空涉事副驾驶使用消防斧实施“恐怖袭击”

新京报
2026-10-03 16:08:43
2026-10-04 04:47:00
学术头条
学术头条
致力于学术传播和科学普及,重点关注AI4Science、大模型等前沿科学进展。
1487文章数 5081关注度
往期回顾 全部

科技要闻

英伟达盘中创历史新高,市值逼近6万亿美元

头条要闻

刚刚拿到绿卡 中国籍夫妻突发车祸身亡

头条要闻

刚刚拿到绿卡 中国籍夫妻突发车祸身亡

体育要闻

这个讨论了一夏天的问题,马刺有答案了吗

娱乐要闻

马思纯一家爬山祈福!素颜出镜笑容甜

财经要闻

4亿台电视挂墙落灰 为何没人愿意开了?

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

本地
数码
时尚
房产
手机

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

数码要闻

开发者将iPhone 17 Pro Max变成MacBook Pro的第二块GPU

Chemena Kamali写给Chloé的又一封情书

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

手机要闻

华为Mate 90 Pro Max旗舰机首个版本更新内容曝光,实装四卡三待、3D动态照片等功能

无障碍浏览 进入关怀版