网易首页 > 网易号 > 正文 申请入驻

强化学习先驱 Andrew Barto 与 Richard Sutton 获得2024图灵奖

0
分享至

文章来源于机器之心

人工智能学者,再次收获图灵奖!

刚刚,计算机学会(ACM)宣布了 2024 年的 ACM A.M. Turing Award(图灵奖)获得者:Andrew BartoRichard Sutton

他们都是对强化学习做出奠基性贡献的著名研究者,Richard Sutton 更是有「强化学习之父」的美誉。Andrew Barto 则是 Sutton 的博士导师。自 1980 年代起,两位学者在一系列论文中提出了强化学习的主要思想,还构建了强化学习的数学基础,并开发了强化学习的重要算法。两人合著的《Reinforcement Learning: An Introduction》一直是强化学习领域最经典的教材之一。

Andrew Barto 是马萨诸塞大学阿默斯特分校信息与计算机科学荣休教授。Richard Sutton 是阿尔伯塔大学计算机科学教授,同时也是 Keen Technologies 的研究科学家。

ACM 图灵奖常被称为「计算机领域的诺贝尔奖」,奖金为 100 万美元,由谷歌公司提供资金支持。该奖项以提出计算数学基础的英国数学家艾伦・图灵命名。

强化学习,当今 AI 突破的原点

说起强化学习,我们可以想起最近引爆全球 AI 技术爆发的 DeepSeek R1,其中的强化学习算法 GRPO 赋予了大模型极强的推理能力,且不需要大量监督微调,是 AI 性能突破的核心。

再往前看,在围棋上超越人类的 AlphaGo 也是利用强化学习自我博弈训练出的策略。可以说最近的几次 AI 突破,背后总有强化学习的身影。

人工智能领域通常会比较关注智能体的构建 —— 即可以感知和行动的实体。更智能的智能体能够选择更好的行动方案。因此,想出比其他方案更好行动方案概念,对 AI 非常关键。借用自心理学和神经科学的「奖励」— 词,表示向智能体提供的与其行为质量相关的信号。强化学习(RL)是在这种信号下学习更成功行为的过程。

通过奖励学习的理念对动物训练师来说已有数千年历史。后来,艾伦・图灵 1950 年的论文《计算机械与智能》提出了「机器能思考吗?」的问题,并提出了基于奖励和惩罚的机器学习方法。

图灵报告说他进行了一些初步实验,Arthur Samuel 也在 1950 年代后期开发了一个能通过自我对弈学习的跳棋程序。但在接下来的几十年里,AI 的这一方向进展甚微。

直至 1980 年代初,受心理学观察的启发,Andrew Barto 和他的博士生 Richard Sutton 开始将强化学习作为一个通用问题框架进行构建。

他们借鉴了马尔可夫决策过程(MDP)提供的数学基础,在这个框架中,智能体在随机环境中做出决策,每次转换后收到奖励信号,并最大化其长期累积奖励。

与标准 MDP 理论假设智能体知道一切不同,RL 框架允许环境和奖励是未知的。RL 的最小信息需求,结合 MDP 框架的通用性,使 RL 算法可以应用于广泛的问题。

Andrew Barto 和 Richard Sutton 联手或者协同他人,都开发了许多 RL 基本算法。其中包括他们最重要的贡献 —— 时间差分学习(该算法为解决奖励预测问题取得了重要进展),以及策略梯度方法和使用神经网络作为表示学习函数的工具。他们还提出了结合学习和规划的智能体设计,展示了获取环境知识作为规划基础的价值。

同样有影响力的是他们的教科书《Reinforcement Learning: An Introduction》(1998),它仍然是该领域的标准参考,被引用超过 79,000 次。这本书让数千名研究人员理解并为这一新兴领域做出贡献,至今仍激发着计算机科学领域的许多重要研究活动。

尽管 Barto 和 Sutton 的算法是数十年前开发的,但通过将强化学习与深度学习(由 2018 年图灵奖获得者 Bengio、Hinton、LeCun 开创)相结合,强化学习的实际应用已在过去十五年中取得重大进展。于是,深度强化学习技术应运而生。

强化学习最著名的例子是 AlphaGo 计算机程序在 2016 年和 2017 年战胜了顶级人类围棋选手。另一个近期重大成就是聊天机器人 ChatGPT。

ChatGPT 是一个经过两阶段训练得到的大型语言模型(LLM),其中第二阶段采用了一种名为「基于人类反馈的强化学习(RLHF)」的技术,其作用是可以让模型输出符合人类期望。

强化学习在许多其他领域也取得了成功,其中之一是机器人运动技能学习。通过强化学习,机器手可以学会操作物体和解决物理问题;并且这种学习过程可在模拟中完成,然后再迁移到现实世界。

强化学习适用的领域还包括网络拥堵控制、芯片设计、互联网广告、优化、全球供应链优化、改进聊天机器人的行为和推理能力,甚至改进矩阵乘法算法 —— 这是计算机科学中最古老的问题之一。

最后,强化学习还反过来助力了神经科学的发展 —— 强化学习正是受到了该学科的启发。最近的研究,包括 Barto 的研究成果,已经表明 AI 领域开发的某些强化学习算法可为涉及人类大脑中多巴胺系统的广泛发现提供最佳解释。

「Barto 和 Sutton 的工作展示了将多学科方法应用于我们领域长期挑战的巨大潜力,」ACM 主席 Yannis Ioannidis 解释道。「从认知科学和心理学到神经科学的研究领域启发了强化学习的发展,这为 AI 领域的一些最重要进展奠定了基础,并让我们更深入地了解大脑如何工作。Barto 和 Sutton 的工作不是我们已经超越的垫脚石。强化学习继续发展,并为计算和许多其他学科的进一步发展提供了巨大潜力。用我们领域最负盛名的奖项表彰他们是非常恰当的。」

「在 1947 年的一次演讲中,艾伦・图灵表示『我们想要的是一台能从经验中学习的机器』」,谷歌高级副总裁 Jeff Dean 指出。「Barto 和 Sutton 开创的强化学习直接回应了图灵的挑战。他们的工作是过去几十年 AI 进步的关键。他们开发的工具仍然是 AI 繁荣的中心支柱,带来了重大进步,吸引了大量年轻研究人员,并推动了数十亿美元的投资。RL 的影响将持续到未来。谷歌很荣幸赞助 ACM 图灵奖并表彰那些塑造了改善我们生活的技术的个人。」

个人背景

Andrew G. Barto

Andrew Barto 是马萨诸塞大学阿默斯特分校信息与计算机科学系荣誉退休教授。他于 1977 年作为博士后研究助理在马萨诸塞大学阿默斯特分校开始职业生涯,此后担任过多个职位,包括副教授、教授和系主任。Barto 在密歇根大学获得数学学士学位(优等),并在那里获得了计算机与通信科学的硕士和博士学位。

Barto 的荣誉包括马萨诸塞大学神经科学终身成就奖、IJCAI 研究卓越奖(Research Excellence Award)和 IEEE 神经网络学会先驱奖。他是电气和电子工程师协会(IEEE)会士和美国科学促进会(AAAS)会士。

Richard S. Sutton

Richard S. Sutton 是阿尔伯塔大学计算机科学教授、Keen Technologies(一家总部位于德克萨斯州达拉斯的通用人工智能公司)的研究科学家,以及阿尔伯塔机器智能研究所(Amii)的首席科学顾问。Sutton 从 2017 年到 2023 年是 DeepMind 的杰出研究科学家。在加入阿尔伯塔大学之前,他曾于 1998 年至 2002 年在新泽西州 Florham Park 的 AT&T 香农实验室人工智能部门担任首席技术人员。

Sutton 与 Andrew Barto 的合作始于 1978 年,当时在马萨诸塞大学阿默斯特分校,Barto 是 Sutton 的博士和博士后导师。Sutton 在斯坦福大学获得心理学学士学位,在马萨诸塞大学阿默斯特分校获得计算机与信息科学的硕士和博士学位。

Sutton 的荣誉包括获得 IJCAI 研究卓越奖、加拿大人工智能协会终身成就奖和马萨诸塞大学阿默斯特分校的杰出研究成就奖。Sutton 是伦敦皇家学会会士、人工智能促进协会会士和加拿大皇家学会会士。

https://x.com/TheOfficialACM/status/1897225672935735579

https://amturing.acm.org/

© THE END

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
百万提成变29元盲袋,我递辞呈,董事长愣了:刚打钱你走?我冷笑

百万提成变29元盲袋,我递辞呈,董事长愣了:刚打钱你走?我冷笑

晓艾故事汇
2026-07-25 15:11:25
左手长鑫涨疯右手兆易跌停!朱一明资本版图上演冰火两重天

左手长鑫涨疯右手兆易跌停!朱一明资本版图上演冰火两重天

界面新闻
2026-07-27 15:38:56
38岁的女房东,天天想着给我介绍对象,半年后我烦了:不如我娶你

38岁的女房东,天天想着给我介绍对象,半年后我烦了:不如我娶你

五元讲堂
2026-02-28 11:29:46
原来老詹加盟费城另有隐情!满心奔赴心仪强队求职,却被冷漠拒绝

原来老詹加盟费城另有隐情!满心奔赴心仪强队求职,却被冷漠拒绝

阿讯说天下
2026-07-27 14:13:11
难以置信!中考结束后,大量深圳民办学校推送短信,宣传中考复读班,引发争议

难以置信!中考结束后,大量深圳民办学校推送短信,宣传中考复读班,引发争议

火山詩话
2026-07-28 10:23:01
泰山队给国安做嫁衣,弃将2场1球1助攻,比陈蒲拼,韩鹏若下课治标不治本

泰山队给国安做嫁衣,弃将2场1球1助攻,比陈蒲拼,韩鹏若下课治标不治本

替补席看球
2026-07-28 11:45:35
1993年,张学良首次见到冯巩,手中的佛珠突然滑落,沉默良久后问了一句话,得到确认后,老人眼圈红了

1993年,张学良首次见到冯巩,手中的佛珠突然滑落,沉默良久后问了一句话,得到确认后,老人眼圈红了

人生录
2026-07-19 00:05:10
四巨头还没开打就内讧?布朗恩比德互喷假摔,詹姆斯也镇不住

四巨头还没开打就内讧?布朗恩比德互喷假摔,詹姆斯也镇不住

宝哥精彩赛事
2026-07-28 04:56:11
接下来,很多公司都要放长假了

接下来,很多公司都要放长假了

娱乐圈见解说
2026-07-28 09:38:18
中华全国总工会原党组成员、书记处书记、副主席张世平被开除党籍

中华全国总工会原党组成员、书记处书记、副主席张世平被开除党籍

新京报
2026-07-27 17:07:20
特朗普:所有与伊朗打交道的人都请求我不要开火,若谈不拢将打击伊朗,内塔尼亚胡将会晤特朗普,伊朗:绝不允许美国决定何时战何时止

特朗普:所有与伊朗打交道的人都请求我不要开火,若谈不拢将打击伊朗,内塔尼亚胡将会晤特朗普,伊朗:绝不允许美国决定何时战何时止

政知新媒体
2026-07-28 07:54:14
谢霆锋公开力挺王菲之后,张柏芝用一个动作,与前夫彻底划清界限

谢霆锋公开力挺王菲之后,张柏芝用一个动作,与前夫彻底划清界限

东方不败然多多
2026-07-28 05:31:34
订婚宴被逼放弃继承权,我拿起话筒,未婚夫以为我服软却愣住了

订婚宴被逼放弃继承权,我拿起话筒,未婚夫以为我服软却愣住了

晓艾故事汇
2026-07-19 16:23:11
高铁涨价,大巴复活,绿皮车爆火,意外的事接连发生

高铁涨价,大巴复活,绿皮车爆火,意外的事接连发生

智谷趋势
2026-07-27 16:52:50
情况不妙!曝王曼昱将暂停世界大赛

情况不妙!曝王曼昱将暂停世界大赛

乒乓乐园
2026-07-28 09:10:39
韩红“自大言论”与事实真相对比,请仔细看:

韩红“自大言论”与事实真相对比,请仔细看:

情感大头说说
2026-07-19 07:42:55
腾讯开始激进了

腾讯开始激进了

虎嗅APP
2026-07-27 16:50:14
吃孔琳7年“软饭”却爱上柯蓝,现娶乒乓球队员,儿子成国民童星

吃孔琳7年“软饭”却爱上柯蓝,现娶乒乓球队员,儿子成国民童星

手工制作阿歼
2026-07-28 04:56:45
老挝恳请中国铁路继续南下,一路全用中国标准,坚决不搞越南那套

老挝恳请中国铁路继续南下,一路全用中国标准,坚决不搞越南那套

我一直在终点等你
2026-07-13 09:51:37
仅7天!决赛主裁判温契奇突然宣布退役,世界杯冠军争议再升级

仅7天!决赛主裁判温契奇突然宣布退役,世界杯冠军争议再升级

眼界看世界
2026-07-28 12:30:03
2026-07-28 13:20:49
阿里研究院 incentive-icons
阿里研究院
推动商业互联网化
1958文章数 2182关注度
往期回顾 全部

科技要闻

Kimi K3完整开放!2.78万亿参数模型可部署

头条要闻

老人600万积蓄说没就没 瞬间"穿越"到千里外黄金市场

头条要闻

老人600万积蓄说没就没 瞬间"穿越"到千里外黄金市场

体育要闻

传奇同框!63岁乔丹与51岁贝克汉姆共进午餐

娱乐要闻

李登科向李宏毅道歉 称给他道歉不丢人

财经要闻

悟空租车乱象追踪:货不对板与迟来的赔偿

汽车要闻

零跑D19迎来首次OTA推送 智能化体验升级

态度原创

手机
家居
亲子
房产
军事航空

手机要闻

荣耀携手阿莱把电影工作流融入机器人手机:荣耀Robot Phone 8月登场

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

星星救羊,好搞笑的故事

房产要闻

拿下百亩宅地!又一河北民企,重仓海南!

军事要闻

特朗普:若谈判破裂将强力打击伊朗

无障碍浏览 进入关怀版