网易首页 > 网易号 > 正文 申请入驻

北大拿下2篇最佳论文,DeepSeek实习生立功,华人横扫这场AI顶会

0
分享至

智东西7月31日报道,昨天,第63届计算语言学协会年会(ACL 2025)在奥地利召开。作为自然语言处理领域最具学术影响力的会议之一,本届ACL吸引了超过8300多篇论文的投稿,中国大陆科研人员在本届ACL实现明显突破。

最佳论文奖是ACL最受关注的奖项,今年ACL共评选出4篇最佳论文,其中2篇来自中国大陆,分别由北大、DeepSeek和华盛顿大学联合团队,以及北大-灵初智能联合实验室摘得。

DeepSeek等机构的获奖论文以原生稀疏注意力(NSA)为主题,第一作者为袁境阳。袁境阳在DeepSeek实习期间提出了NSA模型,现在在北京大学计算机学院攻读博士学位。DeepSeek创始人兼CEO梁文锋也出现在作者名单中。

NSA可用于超快速的长上下文训练与推理,以性价比极高的方式,罕见地在训练阶段应用稀疏性,在训推场景中均实现速度的明显提升,特别是在解码阶段实现了高达11.6倍的提升。

论文链接:https://aclanthology.org/2025.acl-long.1126/

北大-灵初智能联合实验室首席科学家杨耀东博士团队的获奖论文,则揭示了大模型参数结构中存在的一种弹性机制,并可能导致模型在后训练阶段产生抗拒对齐的行为。这一发现对AI治理和安全问题很有启发意义。

论文链接:https://aclanthology.org/2025.acl-long.1141/

其余2篇最佳论文来自美国、德国。斯坦福大学、康奈尔大学(科技校区)联合团队在获奖论文中提供了一套评估算法公平性的基准测试,并发现现有促进算法公平性的手段存在误区,如果盲目使用可能会适得其反。

论文链接:https://aclanthology.org/2025.acl-long.341.pdf

由德国CISPA亥姆霍兹信息安全中心、TCS Research以及微软三家机构合作的获奖论文,则聚焦于大型语言模型在自主决策中的采样偏差——揭示其背后由“描述性常态”与“规定性理想”共同塑造的启发式机制,并通过公共卫生与经济趋势等现实案例,论证这种向理想值偏移的现象如何在实际应用中导致显著偏差与伦理风险。

论文链接:https://aclanthology.org/2025.acl-long.1454/

ACL官方数据显示,2025年,所有投稿论文中的第一作者中,有51.3%来自中国大陆,与去年30.6%的比例实现了明显增长;今年所有作者中,中国大陆作者的比例也达到51%。过去两年,美国在第一作者数量上均位居第二,不过比例已经从2024年的29.6%下降至2025年的14.0%。

以下是本届ACL中两篇来自中国大陆的最佳论文的核心内容梳理:

一、DeepSeek联手北大:新型稀疏注意力机制,让模型解码狂飙11.6倍

北京大学、DeepSeek和华盛顿大学联合团队(后简称联合团队)的获奖论文全名为《原生稀疏注意力:面向硬件对齐且可原生训练的稀疏注意力机制(Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention)》,曾于今年2月份作为DeepSeek-R1开源的系列技术报告之一发布。

什么是稀疏注意力?与传统注意力机制相比,稀疏注意力方法能通过选择性计算关键的查询键对来减少计算开销。不过,现有许多稀疏注意力方法在实际推理中未能显著降低延迟,还无法适应现代高效的解码架构,也缺乏对训练阶段的支持。

联合团队希望解决现有稀疏注意力的两大问题,一是事后稀疏化导致的性能退化,二是现有稀疏方法在长序列训练的效率短板。

NSA的核心思想是通过动态分层稀疏策略,结合粗粒度的token压缩和细粒度的token选择,保留全局上下文感知能力和局部精确性。

在NSA机制中,模型会同时使用三种不同的注意力方式来处理输入文本,每种方式都有它自己的擅长领域:

(1)压缩注意力

这个分支把输入的信息聚合成块,捕捉粗粒度的语义信息,也就是对输入内容的关键信息进行总结提炼。压缩注意力可以减少计算的工作量,但会损失细节。

(2)选择性注意力

为了避免压缩时遗漏重要内容,NSA新增了选择性注意力机制。这一机制给每一块信息打个“重要程度”的分数,并选择最关键的信息进行更细致的计算。这样既能保留关键细节,又不会让计算变得太复杂。

(3)滑动窗口注意力

这个分支负责处理文本中临近的词之间的关系。它会在固定大小的窗口内计算注意力,比如只看当前词前后的几个词,这样可以更好地理解局部上下文。这个机制能防止模型太过依赖前两个机制,而忽视邻近词之间的联系。

整体来看,NSA通过这三种注意力机制互相配合,一方面节省计算资源,一方面又能兼顾全局语义和关键细节。

▲NSA架构概览

为测试NSA机制的实际效果,联合团队在同一模型的基础上,分别使用了不同的注意力机制,比如传统的全注意力机制、NSA机制等,并在多个测试任务上进行比较。

使用NSA机制的模型在9个测试中获得了7项最佳成绩,整体表现超过了其它所有方法,包括全注意力。尤其是在逻辑推理、问答等任务上,采用NSA机制的模型表现较好,这说明它能排除掉不重要的信息,把注意力集中在真正关键的部分。

除了质量方面的提升,NSA还带来效率方面的优势。联合团队在8张A100显卡上做了测试,他们发现:

(1)在64k长度的文本输入下,NSA的前向计算速度是全注意力的9倍

(2)反向计算速度是全注意力的6倍

(3)在解码时,NSA将速度提升至原有的11.6倍

这些提速的关键在于NSA对硬件更友好,比如,其内存访问是按“块”来走的,最大化了张量核心的利用率,而且内部调度机制减少了不必要的计算负担。

二、北大-灵初智能团队:探索模型对齐困境,“弹性”机制或成开源模型隐忧

北大-灵初智能联合实验室首席科学家杨耀东博士团队(后简称该团队)的获奖论文全名为《语言模型抗拒对齐:来自数据压缩的证据(Language Models Resist Alignment: Evidence From Data Compression)》。这一研究揭示了一个关键问题:大语言模型在对齐时其实会反抗。

该团队发现,尽管我们可以通过各类对齐方式让模型变得更“安全”、更“符合人类价值观”,模型本身其实倾向于回到它原来预训练时学到的原始分布。就像一个弹簧被拉伸后又想回到原始状态,这种行为被称为“弹性”。

这种弹性体现在两个方面:

(1)抵抗(Resistance):模型不太愿意改变自己,仍然保留原来的分布特征;

(2)反弹(Rebound):对模型对齐越深,它反弹回原始状态的速度反而越快——如果用反方向训练(比如取消之前的对齐过程),它很快就会打回原形。

研究还发现,这种行为可以用压缩率变化来衡量——也就是说,模型对不同数据集的学习压缩程度变化,与数据量大小成反比。

为了进一步解释这种行为,该团队构建了一个理论模型:语言模型训练和对齐过程其实是一种信息压缩过程。他们基于“压缩定理”(compression theorem)和“压缩协议”(compression protocol),从信息论的角度来分析模型为什么会产生“弹性”——这为理解为什么对齐不稳定提供了数学框架。

最后,该团队通过一系列实验,验证了这一现象在不同的大模型中都存在。这说明“弹性”并不是个别模型的特例,而是语言模型训练过程中一种普遍的内在机制。

因此,要想实现真正稳固的对齐,不能只停留在表层的微调,而必须深入理解并对抗这种由压缩机制引发的反对齐倾向。

该团队还基于模型弹性机制,提出了对开源策略的思考。

一方面,开源模型权重有助于研究者快速发现漏洞、推动大规模对齐与安全研究;另一方面,模型弹性也意味着,即便是通过审计和安全微调的模型,如果被公开,一旦出现更先进的反对齐手段,这些模型也可能很容易被重置到未对齐状态,大大降低模型“越狱”的门槛,破坏原有的安全机制,带来现实风险。

结语:华人AI研究者集体崛起,安全成为ACL热点议题

除了中国大陆团队在最佳论文奖上的杰出表现,ACL 2025还见证了华人AI研究者的集体崛起。

本届ACL评选出26篇杰出论文,这是重要性仅次于最佳论文的奖项。这26篇论文中,有13篇论文的第一作者为华人,占比达50%。这也显示出,华人AI研究者在全球范围内的学术影响力,正不断扩大。

值得一提是,ACL的获奖论文中,有大量以AI安全、监督、对齐等为主题,学术界对这些重要议题的关注,给产业界的AI研究提供了极为有益的补充。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
堪称最离谱的枕边翻车现场,清华学霸杨奇函被女友趁熟睡时蚂蚁搬家式转走百万

堪称最离谱的枕边翻车现场,清华学霸杨奇函被女友趁熟睡时蚂蚁搬家式转走百万

东方不败然多多
2026-08-22 04:34:50
开始收网?逃到英国两年,丁玉梅再遭2大噩耗,两儿子也被拖下水

开始收网?逃到英国两年,丁玉梅再遭2大噩耗,两儿子也被拖下水

琴音缭绕回
2026-08-23 22:38:41
“甲醛大户”被揪出,3种蔬菜含甲醛,吃了会致癌?告诉你真相

“甲醛大户”被揪出,3种蔬菜含甲醛,吃了会致癌?告诉你真相

39健康网
2026-08-23 16:01:52
羽球世锦赛!5金出炉,日本惨败,国羽连被爆冷丢冠,安洗莹封后

羽球世锦赛!5金出炉,日本惨败,国羽连被爆冷丢冠,安洗莹封后

南海浪花
2026-08-24 00:36:30
敲钟现场全程黑脸,宇树科技的王兴兴,或成为下一个许家印?

敲钟现场全程黑脸,宇树科技的王兴兴,或成为下一个许家印?

南宗历史
2026-08-23 07:29:46
香港奴性十足,澳门媒体批评其双标:外国人光膀子大闹没事,内地人喝口水就挨罚!评论区一片怒火

香港奴性十足,澳门媒体批评其双标:外国人光膀子大闹没事,内地人喝口水就挨罚!评论区一片怒火

谭谈社会
2026-08-23 16:05:45
两性关系:55-75岁这20年,惜命最好的方式,不是锻炼,而是这4点

两性关系:55-75岁这20年,惜命最好的方式,不是锻炼,而是这4点

三农老历
2026-08-22 09:29:49
海风:美式“台海旧剧本”,该被淘汰了

海风:美式“台海旧剧本”,该被淘汰了

环球时报国际
2026-08-23 11:36:46
下周预期要大涨题材  这四大热点刷屏全网!这个方向主力已提前抢筹

下周预期要大涨题材 这四大热点刷屏全网!这个方向主力已提前抢筹

元芳说投资
2026-08-23 19:10:49
接受由解放军负责台湾防卫!今天,岛内传来统一最强音

接受由解放军负责台湾防卫!今天,岛内传来统一最强音

经点星娱
2026-08-23 22:36:53
刘畊宏直播间凉了,“老板娘”的身材戳破了多少人的减肥梦?

刘畊宏直播间凉了,“老板娘”的身材戳破了多少人的减肥梦?

看尽落尘花q
2026-08-23 19:28:46
河北张家口这件事,还是引起公愤了!

河北张家口这件事,还是引起公愤了!

胖胖说他不胖
2026-08-23 10:00:34
周涛与前夫姚科未离婚之前的一张合影照,儒雅的姚科,终究留不住周涛

周涛与前夫姚科未离婚之前的一张合影照,儒雅的姚科,终究留不住周涛

南万说娱26
2026-08-22 08:56:48
就车臣前领导人艾哈迈德·卡德罗夫多年前遇袭身亡,普京最新表态

就车臣前领导人艾哈迈德·卡德罗夫多年前遇袭身亡,普京最新表态

环球网资讯
2026-08-23 16:01:17
“钟才文”罕见连续两天亮相《人民日报》,信息量很大!

“钟才文”罕见连续两天亮相《人民日报》,信息量很大!

识局Insight
2026-08-23 19:41:39
箭体倒地、着陆腿压断、发动机压损,火箭回收还算成功吗?

箭体倒地、着陆腿压断、发动机压损,火箭回收还算成功吗?

巅峰高地
2026-08-23 10:23:40
韩红基金会再起事端!有湖北网友爆料,长阳土家自治县接受的捐赠救护车质量差,现在都在等报废

韩红基金会再起事端!有湖北网友爆料,长阳土家自治县接受的捐赠救护车质量差,现在都在等报废

火山詩话
2026-08-23 18:52:31
补时绝杀!曼城2-1逆转获英超开门红 哈兰德屡失良机 亿元新援伤退

补时绝杀!曼城2-1逆转获英超开门红 哈兰德屡失良机 亿元新援伤退

我爱英超
2026-08-23 23:02:20
1米85跳高女神胡麟鹏突然宣布退役,刚结婚两个月,老公比她小8岁

1米85跳高女神胡麟鹏突然宣布退役,刚结婚两个月,老公比她小8岁

米修体育
2026-08-23 21:45:32
克莱·汤普森在买断协议中向独行侠队退还近1000万美元,情义在

克莱·汤普森在买断协议中向独行侠队退还近1000万美元,情义在

好火子
2026-08-23 05:36:14
2026-08-24 05:07:00
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12483文章数 117161关注度
往期回顾 全部

科技要闻

“英伟达发通知:涨价15%以上”

头条要闻

男子凌晨浏览黄色网站深陷"约炮"骗局 21.8万没了

头条要闻

男子凌晨浏览黄色网站深陷"约炮"骗局 21.8万没了

体育要闻

46岁小罗复出,为什么选了一支意丙球队?

娱乐要闻

王传君的舞台,藏着与乔任梁的过往

财经要闻

加拿大宣布“全额对等报复”美国新关税

汽车要闻

刘苗苗:极狐不押注单一爆款,增长进入体系化阶段

态度原创

时尚
旅游
游戏
亲子
公开课

夏天别总穿白色T恤,试试这几款衬衫,配裤子裙子都显气质

旅游要闻

不追大理热门打卡地,烟火古寺观音塘,读懂大理温柔底色!

《GTA6》泄露视频现实早有原型!老头往车厢里加油

亲子要闻

32岁的全职妈妈的重生之路终篇

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版