网易首页 > 网易号 > 正文 申请入驻

北大DeepSeek论文或预定ACL Best Paper!梁文锋署名

0
分享至

新智元报道

编辑:定慧 好困

【新智元导读】北大DeepSeek联合发布的NSA论文,目前已被ACL 2025录用并获得了极高评分,甚至有望冲击最佳论文奖。该技术颠覆传统注意力机制,实现算力效率飞跃,被誉为长文本处理的革命性突破。

重磅惊喜!

,将有望斩获ACL 2025最佳论文(ACL Best Paper)。

论文地址:https://arxiv.org/abs/2502.11089

要知道,总投稿数高达8000多篇,创历史之最,而ACL 2024总投稿数仅为4407,几乎翻倍!

原生稀疏注意力(Native Sparse Attention,NSA)论文的Meta Review的OA分数已经确认得到了4.5分,这是一个相当高的分数,满分为5分。

按照ACL的OA评分标准,4.5分已经获得了Borderline Award,也就是说非常有望获得ACL这届的最佳论文。

这篇论文的发布在当时引起广泛的社区关注,NSA把AI行业的焦点从「模型规模竞赛」拉向「算力效率竞赛」,堪称2025年上半年最具杠杆效应的底层技术突破之一。

DeepSeek-R1的发布引发了AI行业的「价值重估」,DeepSeek用「低成本+同效能」的开源技术撼动了当时AI界人们固有的「有卡才行」的认知。

而NSA技术进一步实现了「长下文的算力平权」,让开源模型也能达到闭源模型(ChatGPT、Gemini等)才能满足的上下文窗口。

NSA将长文本处理速度提高了最多11倍,该方法结合了算法创新和改进的硬件,提高效率而不用牺牲硬件性能。

NSA的出现,是对传统注意力机制的一次革新,传统模型依赖于全注意力机制,将每个Token与其他所有Token进行比较。

传统机制虽然对于短篇文本有效,但随着文本长度的增加,这一过程会显著变慢,并且计算成本变得非常高。

NSA是DeepSeek-R1「爆火出圈」后的第一篇论文,同时在NSA发布一周后,DeepSeek进行了更广为人知的「开源周」活动分享。

硬件对齐与原生可训练稀疏注意力

为什么要革新传统的注意力机制?

长文本处理能力是新一代语言模型的关键需求,但传统注意力机制带来的巨大计算开销一直是一个棘手的问题。

在这种背景下,稀疏注意力机制展现出了提升计算效率同时又能保持模型性能的巨大潜力。

北大和DeepSeek提出名为NSA的创新性稀疏注意力机制,它能够原生支持训练,通过将算法创新与硬件优化相结合,实现了高效的长文本处理。

NSA采用了动态分层的稀疏策略:在保证全局信息获取的同时,还能够精确捕捉局部细节,这得益于其巧妙结合了粗粒度的令牌压缩和细粒度的令牌选择。

NSA架构如下图所示,通过三条并行的注意力分支来处理输入序列。对于每一个查询(query),前面的键(key)和值(value)会分别被处理成三种不同的注意力方式:

  • 压缩注意力(Compressed Attention),用于捕捉粗粒度的整体模式;

  • 选择性注意力(Selected Attention),专注于重要的词块;

  • 滑动注意力(Sliding Attention),负责获取局部上下文信息。

每条分支所生成的不同注意力模式。图中的绿色区域表示需要计算注意力分数的部分,而白色区域则是可以跳过、不计算的区域。

NSA的主要创新点有两个:一是通过精心设计的算法平衡了计算密度,并针对现代硬件做了专门优化,显著提升了运行速度;二是实现了端到端的训练模式,在确保模型性能的前提下大幅降低了预训练的计算量。

如图1所示,实验结果显示:采用NSA预训练的模型在通用基准测试、长文本处理和指令推理等多个任务上,性能均达到或超过了使用完整注意力机制的模型。

此外,在处理64k长度序列时,无论是decoding、前向传播还是反向传播,NSA都展现出了显著的速度优势,充分证明了它在模型全生命周期中的高效性。

该论文第一作者为北京大学计算机学院硕士生袁境阳(北京大学,导师为张铭教授),合作者包括高华佐(DeepSeek),代达劢(DeepSeek),罗钧宇(北京大学)、肖之屏(华盛顿大学)等。

通讯作者为梁文锋(DeepSeek),曾旺丁(DeepSeek),张铭教授(北京大学)。

录用论文一览

除了NSA论文外,北京大学张铭教授团队的其他论文也同样上榜。

数据为中心视角下大模型的高效后训练

论文名: A Survey on Efficient LLM Training: From Data-centric Perspectives

这是首个从数据中心视角系统性剖析LLM高效后训练的综述。

该文创新性地提出了一个涵盖数据选择、质量增强、合成数据生成、数据蒸馏与压缩及自演化数据生态的分类框架,深入总结了各领域代表性方法并展望未来研究方向,旨在为学界和业界探索大规模模型训练中数据利用的最大潜力提供关键启示。

该论文作者包含罗钧宇(北京大学,导师为张铭教授),吴伯涵(北京大学),罗霄(UCLA),肖之屏(华盛顿大学),靳轶乔(佐治亚理工),涂荣成(南洋理工大学),尹楠(HKUST),王一帆(对外经贸),袁境阳(北京大学),琚玮(四川大学),张铭(北京大学,通讯作者)。

首个金融多模态评估数据集FinMME

论文名:FinMME: A Financial Multi-Modal Evaluation Dataset

为应对金融领域多模态大模型评估的迫切需求,并提供高质量的多模态推理验证数据集。

北京大学Dlib实验室联合香港科技大学等重磅推出了首个大规模、高质量的金融多模态评估数据集FinMME。

该数据集包含超过11,200个金融研究样本,覆盖18个核心金融领域和10种主要图表类型,并引入独创的FinScore评估系统。

实验结果表明,即便是顶尖模型如GPT-4o在FinMME上也面临显著挑战,凸显了其在衡量金融多模态理解与推理能力方面的深度与价值。

论文作者包含罗钧宇(北京大学,导师为张铭教授),寇智卓(HKUST),杨礼铭(北京大学),罗霄(UCLA),黄进晟(北京大学),肖之屏(华盛顿大学),彭靖姝(HKUST),刘程中(HKUST),吉嘉铭(HKUST),刘譞哲(北京大学),韩斯睿(HKUST),张铭(北京大学,通讯作者),郭毅可(HKUST)。

大语言模型中的数学推理增强方法

该论文涉及大语言模型中的数学推理增强方法。思维链(CoT)提示已成为激发大语言模型(LLM)推理能力的核心方法,但其生成的推理步骤中存在难以检测的「幻觉」。

现有的消除大语言模型幻觉的方法如过程奖励模型(Process Reward Model)或自一致性校验如同黑箱操作,难以提供可验证的证据,制约了纠正幻觉的能力。

论文提出一种创新的Safe验证框架。区别于传统模糊评分机制,Safe创新性地证明验证定理的正确性,从根本上识别并消除幻觉。实验表明,本论文提出的Safe验证框架在多个数学模型和数据集上实现显著性能提升,实现神经符号系统在数学推理中的有机融合。

本研究回归了形式数学语言的初衷——为人类易错的证明过程提供坚实保障。Safe框架为数学教育、代码生成等高风险领域提供了可验证的推理解决方案。

该论文第一作者为数据科学与工程所博士生刘成武(北京大学,导师为张铭教授),合作者包括袁野(北京大学)、尹伊淳(华为诺亚方舟实验室)、许妍(华为诺亚方舟实验室)、许鑫(香港科技大学)、陈造宇(香港理工大学)、尚利峰(华为诺亚方舟实验室)、刘群(华为诺亚方舟实验室)、张铭(北京大学,通讯作者)。

基于大语言模型的交通流量预测方法

论文名: Embracing Large Language Models in Traffic Flow Forecasting

交通流量预测旨在基于历史交通状况和路网结构,预测未来交通流量,这是智能交通系统中的关键问题。

现有方法主要聚焦于捕捉和利用时空依赖性来进行流量预测,尽管取得了一定进展,但在面对测试时交通条件变化时表现不足。

针对这一挑战,本文提出了一种基于大语言模型(LLM)的新方法——LEAF (Large Language Model Enhanced Traffic Flow Predictor)。

与以往工作主要使用LLM的生成能力来直接生成未来交通流量序列不同,LEAF使用LLM的判别能力。

具体来说,LEAF采用双分支结构,分别通过图结构和超图结构捕捉不同的时空关系。两个分支在预训练阶段独立训练,并在测试时生成不同的预测结果。

随后,利用大语言模型从这些预测中选择最有可能的结果,并通过排序损失函数作为学习目标来增强两个分支的预测能力。在多个数据集上的广泛实验验证了LEAF的有效性,证明其在流量预测任务中能够更好地适应测试环境变化。

该论文第一作者为数据科学与工程所博士生赵禹昇(北京大学,导师为张铭教授),合作者包括罗霄(加州大学洛杉矶分校)、温浩珉(卡耐基梅隆大学)、肖之屏(华盛顿大学)、琚玮(四川大学),张铭(北京大学,通讯作者)。

作者介绍

袁境阳

北京大学计算机学院研究生,导师为张铭教授。

主要研究方向是高效大语言模型和稀疏注意力机制,曾获北京市优秀毕业生、北京大学优秀毕业生等称号。

罗钧宇

北京大学计算机学院博士生,导师为张铭教授。

他的研究方向关注于高效的LLM、LLM后训练、自适应学习等。

在ICML,CVPR,ACL,TPAMI等顶级刊物上以第一作者发表多篇文章。

赵禹昇

北京大学计算机学院研究生,导师为张铭教授。

研究方向包括图神经网络、时空预测、多模态等,关注测试数据的分布偏移问题。

刘成武

北京大学计算机学院数据科学与工程所博士生,导师是DLIB实验室的张铭教授。

他的研究方向是自然语言处理、大语言模型的数学推理和自动定理证明。

他在北京大学外国语学院获得了文学学士学位,并修读获得了信息科学技术学院的计算机科学与技术双学位。

张铭

北京大学计算机学院二级教授,博士生导师,北大-安克大模型算法与应用联合实验室主任。2021年CCF杰出教育奖获得者。

张铭教授本硕博都毕业于北京大学计算机系,长期致力于机器学习、图神经网络、知识图谱、文本挖掘、语言模型、推荐系统、教育大数据、科学智能等相关研究。

先后主持国家重点研发计划课题、国家自然科学基金等前沿项目,发表科研论文 300 多篇,谷歌学术被引用21800余次。合作提出的LINE模型是图机器学习领域著名的的基准模型,目前单篇被引用 6700 余次。

获得了机器学习顶级会议ICML 2014唯一的最佳论文奖,以及WWW 2016 最佳论文提名。

在近期利用率仅为20%左右的几大顶会中,张铭教授的课题组的中概率都在50%以上。

其中,在ICML 2025中了4篇论文。

AAAI 2025也是5篇上榜。

还有ICLR 1篇,KDD 1篇,NAACL 1篇主会 2篇Finding。

参考资料:

https://luo-junyu.github.io

https://pkudlib.github.io/

https://mp.weixin.qq.com/s/nvjSyUBR4DBBQgF1e1OwsQ

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
教育部应该反思,即使是北京大学,也会撕毁一个天才数学家

教育部应该反思,即使是北京大学,也会撕毁一个天才数学家

回旋镖
2026-07-19 13:21:11
8万人面前泪如雨下!39岁梅西戴上银牌:过于悲伤 坐地上偷抹眼泪

8万人面前泪如雨下!39岁梅西戴上银牌:过于悲伤 坐地上偷抹眼泪

风过乡
2026-07-20 06:48:11
比恩佐更拉胯!阿根廷世界杯丢冠头号罪人!离谱失误坑惨全队

比恩佐更拉胯!阿根廷世界杯丢冠头号罪人!离谱失误坑惨全队

澜归序
2026-07-20 06:45:47
社科院雷颐教授惊人言论流出:离开日语,我们就基本上没办法说话

社科院雷颐教授惊人言论流出:离开日语,我们就基本上没办法说话

小徐讲八卦
2026-07-17 10:34:47
三方交易:多尔特内姆哈德赴老鹰 雷霆获3次轮签 独行侠获里萨谢

三方交易:多尔特内姆哈德赴老鹰 雷霆获3次轮签 独行侠获里萨谢

醉卧浮生
2026-07-20 00:16:42
重磅!中国无限期暂停了“西伯利亚力量-2”跨国天然气管道的所有谈判

重磅!中国无限期暂停了“西伯利亚力量-2”跨国天然气管道的所有谈判

山间听雨
2026-07-19 18:27:47
发现以色列人立即驱逐!马来西亚放狠话:不认以色列,护照都不认

发现以色列人立即驱逐!马来西亚放狠话:不认以色列,护照都不认

青青子衿
2026-07-19 20:13:10
世界杯第2冠!西班牙封王瞬间:亚马尔跪地 多人落泪 传奇狂欢

世界杯第2冠!西班牙封王瞬间:亚马尔跪地 多人落泪 传奇狂欢

叶青足球世界
2026-07-20 06:27:08
旅游旺季不旺——那只是飓风来临前树枝的颤抖

旅游旺季不旺——那只是飓风来临前树枝的颤抖

细雨中的呼喊
2026-07-18 22:24:42
今夜无眠,史诗级救市已经开启!

今夜无眠,史诗级救市已经开启!

深水财经社
2026-07-20 00:49:03
博主爆料华山没游客,并非暑假没人,而是自己作没的,网友已清醒

博主爆料华山没游客,并非暑假没人,而是自己作没的,网友已清醒

谭谈社会
2026-07-19 19:30:16
世界杯奖项汇总:西班牙获4大奖!罗德里获金球,19岁中卫获金童奖

世界杯奖项汇总:西班牙获4大奖!罗德里获金球,19岁中卫获金童奖

我爱英超
2026-07-20 06:43:31
蒋方舟抄袭了一本诺奖得主神作:一群孩子被制造出来,只为割掉所有器官供给有钱人

蒋方舟抄袭了一本诺奖得主神作:一群孩子被制造出来,只为割掉所有器官供给有钱人

知识圈
2026-07-19 13:20:08
俄罗斯为何“拦不住无人机”?

俄罗斯为何“拦不住无人机”?

中国新闻周刊
2026-07-19 15:42:20
俄生死关头,普京坚持不求中国!中国迅速做了一个重要决定!

俄生死关头,普京坚持不求中国!中国迅速做了一个重要决定!

混沌录
2026-07-20 00:07:08
世界杯决赛巨大争议!尼科进球被吹,阿根廷又获益,名宿集体开炮

世界杯决赛巨大争议!尼科进球被吹,阿根廷又获益,名宿集体开炮

奥拜尔
2026-07-20 05:37:21
一加沙难民把17个家人合法带进英国,在野党怒斥可耻,中国网友评论令人意想不到

一加沙难民把17个家人合法带进英国,在野党怒斥可耻,中国网友评论令人意想不到

可达鸭面面观
2026-07-19 14:44:58
西班牙1-0阿根廷,世界杯奖金分配出炉:总额49亿破纪录 冠军3.4亿

西班牙1-0阿根廷,世界杯奖金分配出炉:总额49亿破纪录 冠军3.4亿

侃球熊弟
2026-07-20 06:20:59
难以置信!邹市明拜访丈母娘的片段流出,网友愤怒:糊涂了吧,卑微得就像个入赘的长工

难以置信!邹市明拜访丈母娘的片段流出,网友愤怒:糊涂了吧,卑微得就像个入赘的长工

火山詩话
2026-07-20 05:25:59
曝台湾演员刘德凯云南定居,出行开奔驰老S,72岁状态好仍很帅气

曝台湾演员刘德凯云南定居,出行开奔驰老S,72岁状态好仍很帅气

一盅情怀
2026-07-19 20:30:52
2026-07-20 08:32:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
15733文章数 66962关注度
往期回顾 全部

科技要闻

Kimi K3单项登顶 整体落后前沿模型2-3个月

头条要闻

阿根廷队多次犯规未被裁判出牌 队长上半场仅15次触球

头条要闻

阿根廷队多次犯规未被裁判出牌 队长上半场仅15次触球

体育要闻

西班牙捧起大力神杯 美国总统特朗普颁奖

娱乐要闻

王侃因病逝世 两年前与父亲牛犇同台

财经要闻

任泽平VIP会员自称爆仓巨亏千万

汽车要闻

被追尾还能自动加速逃生?华为乾崑智驾ADS 5.0 OTA时间表发布,只有这台车不用等!

态度原创

家居
教育
健康
旅游
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

QS前100的英国大学真的好就业吗?

刮痧也会刮出脑梗?讲个真实案例

旅游要闻

厌烦城市闷热喧嚣,施甸椅子山原生态村落,低成本实现田园慢生活

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版