网易首页 > 网易号 > 正文 申请入驻

100万美元图灵奖奖金,强化学习师徒想献给科研自由

0
分享至

新智元报道

编辑:LRS

【新智元导读】80年代,当强化学习被冷落,这对师徒没有放弃;如今,重看来时路,他们给出的建议仍然是,「坚持」住自己的科研思想。

3月5日,计算机学会(ACM)宣布Andrew Barto和Richard Sutton获得图灵奖,以表彰其在强化学习领域做出的奠基性贡献。

自从9年前AlphaGo围棋大胜,引爆全民RL狂欢,再到如今Deepseek-R1等推理模型的火热,足以证明强化学习在人工智能领域的长久影响力。

最近,Communications of the ACM发布了一段对师徒二人的采访,从强化学习的研究经历,聊到对人工智能的未来预测。

Barto侧重于多智能体协作学习,Sutton则认为AGI还需要至少几十年,但最终一定能实现,二人对AI的未来以及强化学习的应用前景都充满希望!

关于两人共同获得的100万美元图灵奖奖金,目前尚未确定具体用途。

Sutton表示可能将其份额捐赠给共同创立的Openmind研究所,给青年科学家提供「奢侈」的科研自由,让他们像自己当年那样专注探索基础性问题。

Barto则计划用奖金在马萨诸塞大学(UMass)设立研究生奖学金。

强化学习萌芽

1975年的斯坦福校园里,当时还是心理学专业的本科生Richard Sutton,翻遍了图书馆里所有关于机器智能的文献,认知受到了巨大冲击。

他对主流的「模式识别」和「示例学习」观点感到失望,认为动物并不是这么学习的,而是通过某种奖励反馈机制(They do things to get rewards.)。

当时,唯一将奖励与学习联系起来的研究人员是美国空军实验室的A. Harry Klopf,认为脑细胞会主动寻求奖励。

Sutton立即决定给Klopf写信,并在1978年心理学毕业后,在马萨诸塞大学阿默斯特分校从事研究,主要工作就是测试Klopf的观点。

团队当时有一位博士后Andrew Barto,在接受空军和国家科学基金会长达五年的资助后,除了一份报告,并没有交付出任何成果。

Barto于1970年获得密歇根大学数学学士学位,1975年获得计算机科学博士学位,最终成为UMass自适应网络实验室(现为自主学习实验室)的联合主任,2012年退休。

Sutton加入实验室后,成为了Barto的第一位博士生,二人最终发展出了现代强化学习技术,奖励也是其中的核心,通过设计奖励信号来训练神经网络,让神经元顺着预期方向发展。

1984年,Sutton在马萨诸塞大学安姆斯特分校(University of Massachusetts at Amherst)获得了博士学位,直到1994年,Sutton都是GTE Laboratories的计算机和智能系统实验室的技术组的主要成员,随后又以资深研究科学家的身份回到了马萨诸塞大学安姆斯特分校。

任职期间,Barto和Sutton共同出版了《强化学习导论》,获得了超8万次引用,2018年又发行了第二版,至今仍是全球AI学子的圣经。

同时,Sutton加入AT&T Shannon Laboratory担任人工智能部门的主要技术组成员,研究方向围绕着决策者与其环境交互时所面临的学习问题,持续改进自己对世界的表征和模型的系统。

2003年之后,Sutton成了阿尔伯塔大学计算机科学系的教授和 iCORE Chair,领导着强化学习与人工智能实验室(RLAI)。

不过,说起强化学习的历史,Barto也提到,他们的思路并不新鲜。

早在1954年,人工智能先驱马文明斯基(Marvin Minsky)的博士学位论文主题就是模拟神经的强化学习系统,也是IBM计算机科学家Arthur Samuel用来训练计算机下棋的方法。

然而,到了20世纪70年代,这个想法已经过时,大多数AI研究员都在设计专家系统,Barto也庆幸自己能够保持「不合时宜」。

Barto和Sutton提出的一个关键技术是「时间差分学习」(temporal difference learning)。

比如,想教一台计算机学习下棋,奖励信号如果是赢得游戏,那中间哪些动作步骤是正确的,仍然无法确定;即时奖励可以在计算机预测一步后,反馈出离最终奖励仍然有多少距离,比如胜率是否增加。

预测随时间的变化(时间差)提供强化信号,那么在下次计算机下棋时,就可以采取那些能增加胜率的动作。

破圈

2016年,一场围棋人机大战,让强化学习广为人知,连学术圈之外的人都能聊两句「阿尔法狗」。

Google DeepMind开发的AlphaGo,最终以四胜一败击败李世乭,赛后韩国棋院授予AlphaGo为荣誉九段。

2017年,AlphaGo Master以3:0的战绩,击败了世界排名第一的围棋棋手柯洁,从此人类棋手再无一人是机器的对手。

可以说,强化学习让「围棋」死了一半。

之前的机器学习方法主要是有监督学习和无监督学习,在有监督设置下,人工标注样本给机器进行学习,样本量有限,无法适应「围棋」这种特征空间很大的情况;而无监督学习则是自动提取出有效特征,以在数据中找到结构。

这两种方法在计算中都已被证明是有用的,但都不是生物大脑的学习方式。

强化学习的思路是,当神经网络实现了一个指定目标(比如赢得棋局)时,就会获得一定数值的奖励;如果失败了,会得到一个负值奖励。

机器可以通过不断试错来学习,尝试不同的移动,最终学到了在不同场景下应该使用哪种移动方式。

此后,强化学习一路高歌猛进,不仅攻克了各种电子竞技游戏,还引发了大型语言模型的推理革命,比如OpenAI o系列、DeepSeek-R1等推理模型,已成为新的研究主流。

人工智能的未来

Barto预测人工智能领域将向多智能体强化学习(multi-agent RL)方向演进,由神经网络社群及其个体奖励系统将形成互动,这种机制可能进一步催生出协作网络,多个模型为实现共同目标而互相奖励,也可能引发持有不同目标的智能体之间的利益冲突。

此类交互将对经济学与博弈论等复杂领域产生深远影响。

Sutton则认为人工智能发展仍处于初级阶段,包括向通用人工智能(AGI)的探索,即机器能理解人类认知范围内的所有事物,Sutton坚信强化学习将在这一进程中发挥关键作用。

谈到给年轻计算机研究人员的建议,Barton倡导效仿二人的科研路,勇敢追随自己的研究兴趣,不必在意领域内其他人的看法。虽然这很困难,但你必须找到内在驱动力,并尽你最大的能力坚持下去。

Sutton则给出更具体的建议,「坚持写作」,通过文字记录来锤炼思想。

一说起计算机科学的未来,Sutton就充满信心:未来几十年内,人类将彻底破解人工智能的奥秘!这有可能是史上最伟大的智力飞跃,能为其贡献绵薄之力是我们的荣幸。

参考资料:

https://cacm.acm.org/news/a-rewarding-line-of-work/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
49岁赵薇广东饭局近照疯传!瘦脱相显凶相,当年的小燕子彻底凉透了

49岁赵薇广东饭局近照疯传!瘦脱相显凶相,当年的小燕子彻底凉透了

扒星人
2026-08-22 16:54:24
美对部分加拿大商品加征50%关税 美方:加拿大拒绝在最后期限前与美国最终敲定贸易协议 并仍在继续对美国采取报复性措施

美对部分加拿大商品加征50%关税 美方:加拿大拒绝在最后期限前与美国最终敲定贸易协议 并仍在继续对美国采取报复性措施

每日经济新闻
2026-08-22 22:19:07
七夕无礼物引发的致命决裂:苏州情侣争吵惨案,一时冲动毁掉两条人生

七夕无礼物引发的致命决裂:苏州情侣争吵惨案,一时冲动毁掉两条人生

牧牧颖讲案子
2026-08-22 14:27:06
炸药无人机闪击德机场!德国掀桌撕毁条约,全面清洗俄中心

炸药无人机闪击德机场!德国掀桌撕毁条约,全面清洗俄中心

一簌月光
2026-08-22 22:53:40
爱读书的女孩:那不是消遣,是为自己预留的停留时长

爱读书的女孩:那不是消遣,是为自己预留的停留时长

疾跑的小蜗牛
2026-08-22 20:37:54
一年能给国家上交1.65万亿税收的烟草行业,突然被国家重拳整治了

一年能给国家上交1.65万亿税收的烟草行业,突然被国家重拳整治了

流苏晚晴
2026-08-22 16:52:15
女教师支教12年,临走村民要45万费用,她:我等的就是这一天!

女教师支教12年,临走村民要45万费用,她:我等的就是这一天!

烟火人间故事汇
2026-08-22 14:20:12
英甲太残酷了:1-2大冷门,英超前冠军不敌伯顿队,连续2轮不胜

英甲太残酷了:1-2大冷门,英超前冠军不敌伯顿队,连续2轮不胜

侧身凌空斩
2026-08-22 23:56:00
她拒唱国歌否认是中国籍,还将俩儿子户口落到国外,她现状如何?

她拒唱国歌否认是中国籍,还将俩儿子户口落到国外,她现状如何?

云深不知在何处
2026-08-17 09:19:00
斯诺克战报:乱套了!“5大魔王”全跑了,丁俊晖“上上签”开战

斯诺克战报:乱套了!“5大魔王”全跑了,丁俊晖“上上签”开战

宝哥精彩赛事
2026-08-23 04:46:57
孙骁骁称生二胎是对丈夫与婆家的肯定,实则源于任重及其父母的退让

孙骁骁称生二胎是对丈夫与婆家的肯定,实则源于任重及其父母的退让

陈意小可爱
2026-08-22 15:36:09
结局已定!许家印判无期后,丁玉梅底裤被扒光,难怪能够逍遥海外

结局已定!许家印判无期后,丁玉梅底裤被扒光,难怪能够逍遥海外

探源历史
2026-08-23 05:54:53
17岁身价1.8亿,却被网红甩了?亚马尔的私生活比球赛还精彩

17岁身价1.8亿,却被网红甩了?亚马尔的私生活比球赛还精彩

绿茵八卦君
2026-08-22 07:45:06
格力技校招生报名结束,计划招生300名,最终报名人数达8000人,后续面试环节结束,将公布录取情况

格力技校招生报名结束,计划招生300名,最终报名人数达8000人,后续面试环节结束,将公布录取情况

都市快报橙柿互动
2026-08-22 09:02:12
摸一下胸,拘留5天,图啥?

摸一下胸,拘留5天,图啥?

张晓磊
2026-08-22 11:37:55
两性关系:55-75岁这20年,惜命最好的方式,不是锻炼,而是这4点

两性关系:55-75岁这20年,惜命最好的方式,不是锻炼,而是这4点

三农老历
2026-08-22 09:29:49
9月30日截止,人社部提醒,不涨养老金,却锁定日后退休收入

9月30日截止,人社部提醒,不涨养老金,却锁定日后退休收入

沧海一书客
2026-08-22 04:45:26
藏了21年的雷彻底炸了,中国官方发全球征缴令,潘石屹躲得掉吗?

藏了21年的雷彻底炸了,中国官方发全球征缴令,潘石屹躲得掉吗?

明天见灌装冰块
2026-08-13 20:00:24
学医后才知道,保护心血管最好的运动,不是慢跑快走,而是这个

学医后才知道,保护心血管最好的运动,不是慢跑快走,而是这个

路医生健康科普
2026-08-22 10:15:10
终于知道为什么你很有钱的时候连父母都不要告诉了!好惨烈的现实

终于知道为什么你很有钱的时候连父母都不要告诉了!好惨烈的现实

夜深爱杂谈
2026-08-22 20:34:34
2026-08-23 07:27:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
15999文章数 67017关注度
往期回顾 全部

科技要闻

苹果裁员200人:Vision Pro砍游戏团队

头条要闻

全季起诉“金季”索赔10万 老板娘:日租才50到60元

头条要闻

全季起诉“金季”索赔10万 老板娘:日租才50到60元

体育要闻

字母+汤神,有没有搞头?

娱乐要闻

《空枪》预测票房缩水,手握王炸都没赢

财经要闻

蔡昉解读经济:扩大消费需求的政策思考

汽车要闻

钛9全球首秀/四季度上市 方程S系列内饰车展亮相

态度原创

本地
家居
亲子
旅游
军事航空

本地新闻

《牛来》的一声“妈妈”,到底多少人被精神污染了

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

孩子的教育问题和心理问题

旅游要闻

视频丨看电影、赏美景 暑假到西藏“过林卡”感受别样的日光之城

军事要闻

披露林肯号航母内幕的美国军报多人被炒

无障碍浏览 进入关怀版