网易首页 > 网易号 > 正文 申请入驻

ICML放榜!清华阿里拿下最高奖,谷歌DeepMind再封经典

0
分享至


智东西
作者 程茜
编辑 李水青

智东西7月6日报道,今日,全球机器学习领域三大顶会之一ICML公布获奖名单,来自清华大学麻省理工学院两篇与扩散模型相关的论文拿下杰出论文奖(Outstanding Paper Award),这一奖项代表本届获奖论文中的最高水准。


▲ICML官宣获奖名单

其中一篇为清华大学黄高团队论文。除清华大学研究人员外,其作者名单还出现了阿里巴巴集团研究人员的身影。其论文提出了极简算法JustGRPO,该算法在GSM8K数学推理数据集上准确率达89.1%,同时能完整保留扩散模型并行解码的优势。


获得杰出立场论文奖(Outstanding Position Paper Award)的论文,分析了当下的各项对齐技术,并发现恶意主体可轻易利用其实施信息审查与舆论操控。作者为慕尼黑大学博士生Sarah Ball,以及独立AI治理研究者Phil Hackemann。

获得时间检验奖(Test of Time Award的论文来自谷歌DeepMind 2016年发表的论文,其引入了一种利用多个CPU核心来加速单台机器上训练的强化学习框架,在arXiv上的被引用次数超1.5万次。谷歌DeepMind AlphaGo、AlphaZero首席研究员David Silver,谷歌DeepMind CTO、谷歌首席AI架构师Koray Kavukcuoglu均在作者之列。

本次ICML共颁发了2项杰出论文奖、1项杰出立场论文奖、1项时间检验奖。ICML与NeurIPS、ICLR并称机器学习三大顶会,于1980年创立,是全球首个专门聚焦机器学习的顶级学术会议,曾首发了大量里程碑论文。

一、清华、阿里联手,拿下ICML杰出论文

清华大学黄高团队拿下杰出论文奖的论文题目是《灵活性陷阱:重新思考扩散语言模型中任意顺序的价值(The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models)》

扩散大语言模型(dLLMs)打破了传统大语言模型从左至右的刚性生成约束,支持以任意顺序生成文本token。直观来看,这种生成灵活性使其解空间严格包含自回归模型固定单向生成路径所能覆盖的全部范围,理论上具备更强的推理能力。

在数独谜题等特定约束满足类任务中,该特性已被证实具备显著优势。

但该论文提到,针对数学、代码等通用推理任务,无序生成机制反而会限制扩散大语言模型的推理上限。研究人员发现,扩散大语言模型会利用生成顺序的自由度,刻意回避那些不确定性高、对探索关键的token,最终导致模型可覆盖的有效解范围过早收缩。

基于这一发现,该论文重新审视了面向扩散大语言模型的强化学习方案,现有算法为保留无序生成特性,需要处理组合式生成路径、难以计算的似然值等大量复杂问题。

研究人员证明,只需舍弃任意序生成机制、采用标准分组相对策略优化(GRPO),就能更好地激发模型推理能力。他们提出了极简算法JustGRPO,其结构简洁,且在GSM8K数学推理数据集上准确率达89.1%,同时能完整保留扩散模型并行解码的优势。


▲约束模型自由度,可释放更强推理潜力

黄高为清华大学自动化系长聘副教授、博士生导师,清华大学智能产业研究院(AIR)研究员。

根据清华大学自动化系披露的信息,黄高的研究方向为AI基础模型与算法,包括神经网络架构、高效推理算法、强化学习、多模态感知与生成、具身基座模型与世界模型等,在Nature Machine Intelligence、IEEE TPAMI等期刊、会议发表学术论文200余篇,其中CCF A类论文120余篇。


▲黄高(图源:清华大学)

其谷歌学术总引用10.5万次,代表性工作DenseNet单篇被引6.2万次,入选AI2000人工智能领域最具影响力学者。

二、另一杰出论文出自MIT、耶鲁研究人员,提出扩散模型采样算法

与清华黄高团队并列获得杰出论文奖的是,麻省理工学院、耶鲁大学研究人员联合发表的扩散模型相关论文。

论文名称是《扩散模型和对数凹分布的高精度采样(High-Accuracy Sampling for Diffusion Models and Log-Concave Distributions)》。


该论文提出一套扩散模型采样算法:若可获取L²范数下精度为O˜(δ)的分数估计,该算法仅需polylog(1/δ)步即可达到δ误差。

具体复杂度结论分三类场景:

1、在最简数据假设下,算法复杂度为 O~(dpolylog(1/δ)),其中d为数据维度;

2、在非一致L-Lipschitz(利普希茨连续)条件下,复杂度降至O~(dLpolylog(1/δ));

3、若数据分布具备本征维度d⋆,复杂度可进一步简化为O~(d⋆polylog(1/δ))。

此外,该论文方案首次仅依靠梯度求值,就为通用对数凹分布构造出复杂度为polylog(1/δ)的采样器。

获得杰出立场论文奖的是《立场:对齐社区正在无意间打造一套审查工具集(Position:The Alignment Community is Unintentionally Building a Censor’s Toolkit)》。作者为慕尼黑大学计算机器学习方向博士生Sarah Ball,以及独立AI治理研究者Phil Hackemann。

其核心观点为,现代对齐技术最初用于规避模型生成有害内容,但这类技术属于两用技术,恶意主体可轻易利用其实施信息审查与舆论操控。

该论文梳理了现有各类对齐技术,并结合技术被滥用的潜在风险与真实案例,论证人们对“完全对齐模型”的持续追求,反而在无意间为恶意主体打造出性能不断升级的信息主导工具。


▲各类对齐技术的特性及其被滥用的潜在风险

当下AI正快速普及、成为大众核心信息来源,加之全球政治环境日趋威权化,进一步放大了该技术滥用风险,因此学界亟需即刻研讨其两用属性带来的隐患。

研究人员呼吁整个AI领域重视安全机制被蓄意滥用的问题,并提出针对性缓释方案,防范此类两用技术遭到不当利用。

三、8位谷歌DeepMind资深研究员下场,获得时间检验奖

获得时间检验奖(Test of Time Award)的是《深度强化学习的异步方法(Asynchronous Methods for Deep Reinforcement Learning)》。

作者均为谷歌DeepMind资深研究人员。ICML的评语中提到,该论文开创性提出了异步强化学习(RL)概念,并行Actor学习器能够稳定学习过程的观察,启发了众多后续研究。

其中,David Silver领导谷歌DeepMind的强化学习研究小组,是AlphaGo、AlphaZero的首席研究员和AlphaStar的共同负责人;Koray Kavukcuoglu是谷歌DeepMind CTO和谷歌首席AI架构师。


研究人员提出一套原理简洁、轻量的深度强化学习框架,该框架采用异步梯度下降优化深度神经网络控制器。

研究人员基于四种经典强化学习算法分别设计了异步改进版本,并验证并行执行的智能体-学习器结构能够稳定训练过程,让上述四种算法均可有效完成神经网络控制器的训练。

其中性能最优的异步演员-评论家算法,仅依靠单核多线程CPU、无需GPU,训练耗时减半,在Atari游戏测试集上的效果超越了当时的最优基准模型。


▲5款Atari 2600游戏下,DQN算法与新型异步算法的训练速度对比

除此之外,该异步演员-评论家算法不仅能解决各类连续运动控制任务,还可基于视觉输入完成全新的随机三维迷宫导航任务。

结语:清华摘顶会奖项,扩散语言模型站上风口

国际机器学习顶会ICML作为全球AI领域含金量顶尖的学术盛会,此次清华团队拿下重磅奖项,直观印证国内顶尖科研团队在机器学习核心赛道的科研硬实力提升。

与此同时,本届ICML同步有两篇聚焦扩散模型的论文获评重磅奖项,也说明扩散语言模型成为大模型重要演进方向,或成为未来产业界的核心技术路线。


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
普京称俄愿意将中俄免签政策永久化,外交部回应

普京称俄愿意将中俄免签政策永久化,外交部回应

澎湃新闻
2026-09-01 15:59:53
特朗普与委内瑞拉达成石油协议,美方公司将接管多处油田,此前由中石油等中国企业运营,中方:中国在委内瑞拉的合法权益必须得到保障

特朗普与委内瑞拉达成石油协议,美方公司将接管多处油田,此前由中石油等中国企业运营,中方:中国在委内瑞拉的合法权益必须得到保障

政知新媒体
2026-09-01 14:40:22
大外交丨特朗普“密友”戴安斯再度访华,中美近期各领域互动频密

大外交丨特朗普“密友”戴安斯再度访华,中美近期各领域互动频密

澎湃新闻
2026-09-01 19:10:28
远强于英维克?8元低价+液冷CDU龙头+中报暴涨3倍  主力底部抢筹4亿

远强于英维克?8元低价+液冷CDU龙头+中报暴涨3倍 主力底部抢筹4亿

元芳说投资
2026-09-02 06:00:25
广东番禺人苏志刚,把野生动物世界、欢乐世界、海洋王国做到全国出名

广东番禺人苏志刚,把野生动物世界、欢乐世界、海洋王国做到全国出名

趣味萌宠的日常
2026-09-01 11:48:06
曝浓眉可能申请交易!奇才完全信任特雷杨 重点将迪班萨融入体系

曝浓眉可能申请交易!奇才完全信任特雷杨 重点将迪班萨融入体系

罗说NBA
2026-09-01 20:49:13
震撼!科大讯飞男高管出轨超美人妻:丈夫网上举报,大尺度聊天记录曝光,登热搜第一

震撼!科大讯飞男高管出轨超美人妻:丈夫网上举报,大尺度聊天记录曝光,登热搜第一

李晚书
2026-09-02 07:09:59
王晶爆张国荣跳楼内幕!抑郁症只是一方面,受内地金主影响最大

王晶爆张国荣跳楼内幕!抑郁症只是一方面,受内地金主影响最大

可乐谈情感
2026-08-30 07:27:10
44万辆!比亚迪8月销量炸了:海外暴涨134%,国产车终于杀穿全球

44万辆!比亚迪8月销量炸了:海外暴涨134%,国产车终于杀穿全球

小怪吃美食
2026-09-02 00:32:13
继歼10CE后,又一欧洲国家将敲定大单,需动用运20跨洲际空运

继歼10CE后,又一欧洲国家将敲定大单,需动用运20跨洲际空运

巅峰高地
2026-09-01 17:26:16
科威特多个美军基地发生爆炸

科威特多个美军基地发生爆炸

界面新闻
2026-09-02 07:10:02
房贷拉长到40年只是表象,楼市真正的改变大多数人没看懂

房贷拉长到40年只是表象,楼市真正的改变大多数人没看懂

凤凰网财经
2026-09-01 00:33:45
终于知道为何各大车企疯狂降价了,原来是资本已嗅觉到大变化了

终于知道为何各大车企疯狂降价了,原来是资本已嗅觉到大变化了

心中的麦田
2026-09-01 20:38:18
西安“人口自然增长”首为负,小学生十年增量全国第一!

西安“人口自然增长”首为负,小学生十年增量全国第一!

长安范儿
2026-09-01 20:11:45
国外一老哥用32字节的纸,做成了DDR-32内存,还能运行游戏

国外一老哥用32字节的纸,做成了DDR-32内存,还能运行游戏

小柱解说游戏
2026-09-02 00:49:06
369米,110亿!江苏第一大民企的全球总部,一期规模显现

369米,110亿!江苏第一大民企的全球总部,一期规模显现

GA环球建筑
2026-09-01 11:22:55
一女子在美国纽约时报广场持刀伤人,致一死一伤,知情人:女子因拒绝放下刀被警方击毙

一女子在美国纽约时报广场持刀伤人,致一死一伤,知情人:女子因拒绝放下刀被警方击毙

极目新闻
2026-09-01 10:03:42
“典型的上梁不正下梁歪!”家长发视频炫耀,家里没有一个正常人!

“典型的上梁不正下梁歪!”家长发视频炫耀,家里没有一个正常人!

林林先生
2026-08-29 10:51:30
《醒来》当金宝惨死,陈开来才知,原来他才是背叛金宝的幕后真凶

《醒来》当金宝惨死,陈开来才知,原来他才是背叛金宝的幕后真凶

情感大头说说
2026-09-02 01:31:32
G20收到消息,美确定逼中方认栽,外媒断言:美国全球霸权将消亡

G20收到消息,美确定逼中方认栽,外媒断言:美国全球霸权将消亡

铁锤侃侃而谈
2026-09-01 09:07:56
2026-09-02 08:20:50
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12532文章数 117166关注度
往期回顾 全部

科技要闻

抖音突发推荐算法大面积错乱!

头条要闻

专家:尼泊尔5亿吨冰层突然崩塌 或因永久冻土发生变化

头条要闻

专家:尼泊尔5亿吨冰层突然崩塌 或因永久冻土发生变化

体育要闻

大爹杨瀚森,让中国男篮有了容错空间

娱乐要闻

孙宇晨破防,他无法接受孙割这个名字

财经要闻

"电梯亲热门"后 惠州首富给老婆转238亿

汽车要闻

山城试驾启源Q06 不光是智驾好用还有700km的续航

态度原创

旅游
家居
数码
游戏
时尚

旅游要闻

机票酒店价格同步回落,专家给出错峰出游购票攻略

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

漫步者Comfo Clip Q2耳夹耳机开售:399元 海思芯片+开源鸿蒙系统

DLSS5将于9月4日上线 民间模组不代表正式效果

夏天别总穿黑色裤子,试试这几款高腰裙,显瘦优雅又提气质

无障碍浏览 进入关怀版