网易首页 > 网易号 > 正文 申请入驻

突破无规则稀疏计算边界,编译框架CROSS数倍提升模型性能

0
分享至

  • AIxiv专栏是机器之心发布学术、技术内容的栏目。过去数年,机器之心AIxiv专栏接收报道了2000多篇内容,覆盖全球各大高校与企业的顶级实验室,有效促进了学术交流与传播。如果您有优秀的工作想要分享,欢迎投稿或者联系报道。投稿邮箱:liyazhou@jiqizhixin.com;zhaoyunfeng@jiqizhixin.com

本篇工作已被 HPCA 2025 接收,由上海交大先进计算机体系结构实验室蒋力教授课题组(IMPACT)完成,同时也获得了上海期智研究院的支持。第一作者是刘方鑫老师与博士生黄世远。

在现代 AI 模型的快速迭代中,如何在保持模型精度的同时提升计算效率成为关键课题。尤其在大规模 AI 推理中,非结构化稀疏矩阵的计算效率低下成为难以突破的瓶颈。面对这一挑战,我们自主研发了 CROSS—— 一种创新的端到端稀疏编译优化方案,为 AI 推理带来细粒度稀疏计算的加速效果。

稀疏计算的挑战:如何处理非均匀稀疏分布

非结构化细粒度稀疏场景下模型推理效率低下问题是 AI 编译社区面对的关键问题之一。相比于密集算子加速库(cuBlas),主要的稀疏算子加速库或编译框架需要在较高稀疏率下才能获得收益,而过高的稀疏率需求可能使我们面临模型精度下降的风险。

图 1. 相比于 cuBlas,不同稀疏加速库或编译框架在不同稀疏率下的加速比。Sputnik、TVM-Sparse、SparseTIR、ASpT 和 cuSPARSE 在稀疏率超过 76%、80.5%、82.6%、89.4% 和 98.1% 时才能获得正向收益(稀疏矩阵源于 Bert 模型中的稀疏权值矩阵)。

稀疏计算的机会:稀疏负载存在局部性

通过对稀疏模型进行调研我们发现,稀疏矩阵中非零元素的分布展现出严重的非均匀分布特性。这种非均匀分布对稀疏矩阵的计算效率产生了巨大的负面影响:

  • 局部过密:部分区域的非零元素过于密集导致该区域不再适合稀疏矩阵运算;
  • 局部过稀:部分区域的非零元素过于稀疏导致该区域相对于其他区域负载过低,造成计算单元负载失衡问题。这些问题严重影响了稀疏算子的执行效率。

图 2. Llama-2-7B 模型整体 70% 稀疏率场景下非零元素的分布。第 0、1、2 层的 Query weight 矩阵中不同区域的稀疏率跨度很大(30%~99%),展现出严重的非均匀分布特征;第 30、31 层的 Query weight 矩阵中不同区域的非均匀分布特性有所缓解(55%~99%)但依然严重。

CROSS:稀疏编译的破局之道

为应对上述挑战,CROSS 引入了一套全新的编译优化流程。CROSS 首先对稀疏矩阵的结构特点进行深入分析,通过代价模型精准判断稀疏与密集区域的不同计算需求,并自动分配最优的计算资源。其关键步骤包括:

1) 代价模型构建:首先,我们对不同 block 形状下、不同稀疏率下的稀疏矩阵乘(SpMM)和密集矩阵乘(GEMM)执行时间进行分析并建立代价模型(block 内的稀疏分布假设为均匀分布),如图 3 所示。SpMM 开销明显高于 GEMM 开销的稀疏率范围称为密集区(Dense band);将 SpMM 开销明显低于 GEMM 开销的稀疏率范围称为稀疏区(Sparse band),将 SpMM 与 GEMM 的执行开销相近的区域称为摇摆区(Swing band)。

图 3. 不同稀疏率下 SpMM 与 GEMM 的执行时间分布(SpMM 由 Sputnik 实现,GEMM 由 cuBlas 实现,矩阵形状 M=N=K=256, batch=10)。

2) Intra-batch 负载均衡:其次,我们将模型中的稀疏矩阵拆分为多个 block 并依据代价模型评估每个 block 适合的计算范式和计算开销。然后,我们依据 block 之间是否具有累加关系对整个矩阵的计算开销建立代价模型,如图 4(b)所示。针对矩阵中存在的负载不均衡问题,我们将稀疏计算与密集计算分别映射到不同的计算单元执行。当稀疏计算与密集计算的负载差异较大时,我们将摇摆类型的 block 转换为负载较小的类型,以实现单 batch 稀疏矩阵乘法的计算单元负载均衡(如图 4(c)所示)。

图 4. Intra-batch 负载均衡策略。(a)一个稀疏分布不均匀的稀疏矩阵案例。(b)原始稀疏矩阵乘法的执行开销。(c)负载均衡策略下的矩阵乘法执行开销。

3) Inter-batch 负载均衡:此外,由于 batch 之间使用相同的稀疏权值矩阵,当 batch size 较大时,矩阵中不同位置的负载失衡问题持续积累而变得更加严重。针对该问题我们将相邻两个 batch 之间的负载与计算单元的映射关系进行了重排。如图 5(a)所示,简单的将相邻两个 batch 合并执行会造成不同位置的负载失衡效应持续积累,造成更严重的负载失衡问题。为了应对该问题,我们对不同计算单元的负载进行重排序,相邻两个 batch 按照不同的顺序进行计算单元映射,以实现 batch 之间的负载均衡。

图 5. Inter-batch 负载均衡策略。(a)简单粗暴的将相邻两个 batch 合并会造成负载失衡效应累积。(b)对相邻 batch 中不同计算单元的负载重排能大幅缓解负载均衡问题。

实验成果:显著的性能提升

实验结果表明,相比于其他稀疏矩阵加速库或编译框架,CROSS 在不同稀疏率下都获得了显著性能提升,与业界最优设计相比平均获得 2.03× 的性能提升。相比于密集计算(cuBlas),CROSS 在稀疏率超过 60% 时开始获得正收益,显著突破了传统无规则稀疏加速设计的收益边界。

图 6. 五种整体模型稀疏率下,不同稀疏加速设计相比于密集加速库(cuBlas)的模型推理性能。相比于 cuBlas,我们最高可以获得 3.75× 性能收益,同时我们在稀疏率超过 60% 时开始获得正收益,而其他方案则需要接近或超过 80% 稀疏率。

CROSS 的未来:推动稀疏编译应用普及

CROSS 的成功不仅在于提升了稀疏矩阵计算的效率,更为未来 AI 推理在稀疏计算场景下的广泛应用奠定了坚实的基础。在 AI 模型规模不断扩展的今天,稀疏性在大模型中广泛存在,CROSS 为稀疏编译提供了高效、灵活、可持续的发展路径,助力未来 AI 应用的高效部署。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
在日本人眼中,中国颜值最高的"9大美女",日本人审美有多高?

在日本人眼中,中国颜值最高的"9大美女",日本人审美有多高?

落雪听梅a
2026-04-09 07:00:29
玄武门之变后,秦琼随即身亡,李世民:将他排在凌烟阁末位

玄武门之变后,秦琼随即身亡,李世民:将他排在凌烟阁末位

史笔似尘钩
2026-04-07 18:54:15
1990年,被关押40年的地主出狱,写信给王震:记得那1000担粮食吗

1990年,被关押40年的地主出狱,写信给王震:记得那1000担粮食吗

文史道
2025-09-06 12:53:48
郑丽文称台湾是国家,反对两岸统一?喊话大陆:美国让我过去

郑丽文称台湾是国家,反对两岸统一?喊话大陆:美国让我过去

阿器谈史
2026-01-26 20:48:30
福建45岁女子驾车坠河5人遇难,有3名儿童,家属最新发声:司机有十几年驾龄,轿车坠河后其中一遇难小女孩父亲在场,立刻冲了过去

福建45岁女子驾车坠河5人遇难,有3名儿童,家属最新发声:司机有十几年驾龄,轿车坠河后其中一遇难小女孩父亲在场,立刻冲了过去

扬子晚报
2026-04-09 07:49:34
地表最强化学火箭阿耳忒弥斯,其实“慢得很”

地表最强化学火箭阿耳忒弥斯,其实“慢得很”

科学声音
2026-04-08 17:04:11
疯涨400%!光纤价格“狂飙”,四大龙头“躺赚”?

疯涨400%!光纤价格“狂飙”,四大龙头“躺赚”?

览富财经网
2026-04-09 18:27:11
5:0!踢出卫冕冠军的底气,U20亚洲杯八强出炉,中国女足运气不错

5:0!踢出卫冕冠军的底气,U20亚洲杯八强出炉,中国女足运气不错

光辉记
2026-04-09 04:05:25
为什么没人联合打以色列,答案很简单:不是没人想打,是没人敢打

为什么没人联合打以色列,答案很简单:不是没人想打,是没人敢打

墨印斋
2026-04-07 13:47:02
金莎挽着婆婆逛胡同,年龄差成焦点,三人同框像姐妹

金莎挽着婆婆逛胡同,年龄差成焦点,三人同框像姐妹

螃蟹吃瓜摊
2026-04-08 20:27:58
震惊!73岁日本大爷在丰田40年,退休来中国大厂,已离职在找工作

震惊!73岁日本大爷在丰田40年,退休来中国大厂,已离职在找工作

火山詩话
2026-04-09 07:00:22
49岁舒淇承认求子九年:拼尽全力后的和解,才是人生最通透圆满

49岁舒淇承认求子九年:拼尽全力后的和解,才是人生最通透圆满

魔都姐姐杂谈
2026-03-30 12:24:35
中国关键时刻出手,特朗普停火,从摧毁伊朗到全盘接受,24小时

中国关键时刻出手,特朗普停火,从摧毁伊朗到全盘接受,24小时

万千归途
2026-04-10 00:40:18
伊朗低额悬赏美上校:荒诞又羞辱

伊朗低额悬赏美上校:荒诞又羞辱

小眼睛小世界
2026-04-09 09:49:01
医生提醒:若长期一天只吃两顿饭,用不了半年,或患上这4种疾病

医生提醒:若长期一天只吃两顿饭,用不了半年,或患上这4种疾病

39健康网
2026-04-09 20:21:08
王宝强和女友开京牌大G到青岛,冯清人高马大,衬得宝强像小娇夫

王宝强和女友开京牌大G到青岛,冯清人高马大,衬得宝强像小娇夫

八怪娱
2026-04-07 15:02:12
朝鲜进行电磁武器系统试验、战术弹道导弹集束弹头作战运用及威力评估等重要武器系统试验

朝鲜进行电磁武器系统试验、战术弹道导弹集束弹头作战运用及威力评估等重要武器系统试验

每日经济新闻
2026-04-09 17:31:57
日企最后的堡垒正在崩塌,几乎被中企逼上绝路,难怪日媒这么绝望

日企最后的堡垒正在崩塌,几乎被中企逼上绝路,难怪日媒这么绝望

小熊侃史
2026-04-08 07:40:09
奥斯卡罕见抛出“绣球”,海港接不接?球迷:回来当副总吗?

奥斯卡罕见抛出“绣球”,海港接不接?球迷:回来当副总吗?

足球大腕
2026-04-09 13:20:51
苹果iPhone 18 Pro Max实锤!9月正式发布

苹果iPhone 18 Pro Max实锤!9月正式发布

叮当当科技
2026-04-09 05:32:27
2026-04-10 02:16:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
12721文章数 142621关注度
往期回顾 全部

科技要闻

Meta凌晨首发闭源大模型 扎克伯格又行了?

头条要闻

以色列总理:同意与黎巴嫩直接谈判

头条要闻

以色列总理:同意与黎巴嫩直接谈判

体育要闻

8万人面前心脏骤停 现在他还站在球场上

娱乐要闻

金莎官宣结婚 与老公孙丞潇相差18岁

财经要闻

停火又悬了,最糟糕的情况要来了?

汽车要闻

文飞掌舵,给神行者带来了什么?

态度原创

本地
家居
时尚
健康
军事航空

本地新闻

12吨巧克力有难,全网化身超级侦探添乱

家居要闻

清新自然 复古风尚

越来越流行的松弛感穿搭,照着穿就很好看

干细胞抗衰4大误区,90%的人都中招

军事要闻

黎真主党发射火箭弹 回应以违反停火协议

无障碍浏览 进入关怀版