网易首页 > 网易号 > 正文 申请入驻

英伟达护城河被AI攻破,字节清华CUDA Agent,让人人能搓CUDA内核

0
分享至

机器之心编辑部

近日,来自字节跳动 Seed 团队和清华大学 AIR的新研究CUDA Agent,在 AI 领域引发了不小的轰动。

研究人员训练了一个能够编写快速 CUDA 内核的模型:不只是正确的内核,而是真正经过优化的内核。

在简单/中等内核上,它的性能比 torch.compile高出 2 倍;在复杂内核上,它的性能比 torch.compile高出约 92%;即使在最难的设置下,它的性能也比 Claude Opus 4.5 和 Gemini 3 Pro高出约 40%

  • 论文链接:https://arxiv.org/abs/2602.24286
  • 项目主页:https://cuda-agent.github.io/
  • Github链接:https://github.com/BytedTsinghua-SIA/CUDA-Agent
  • 数据集链接:https://huggingface.co/datasets/BytedTsinghua-SIA/CUDA-Agent-Ops-6K

在此之前,GPT、Claude 等大模型已经能写出「正确」的 CUDA 代码,AI 生成的代码也已获得了一定程度的应用,但能跑通和跑得快完全是两码事。

GPU 内核优化是现代深度学习的基础,但它仍然是一项高度专业化的工作,需要深厚的硬件知识。现有的 AI 生成 CUDA 代码通常依赖无训练的提示工程(Prompting)或多轮执行反馈微调的机制。这导致模型只能解决表面上的语法错误,无法真正理解底层硬件逻辑,一定程度上限制了其内在的优化能力。

真正极致的 CUDA 优化需要处理的任务,是只有在性能分析器中才能看到的硬件级指标。人们一直期待能出现一个像人类 CUDA 专家一样思考的 AI。

针对这一矛盾,CUDA Agent 的核心理念简单而巧妙:CUDA 性能并非取决于正确性,而是取决于硬件。线程束、内存带宽、内存冲突——这些只有在性能分析器中才能看到的东西。

研究人员不再奖励「是否编译成功」,而是奖励实际的GPU速度。真实的性能分析数据。强化学习直接基于性能进行训练。

产生的效果出乎人们的预料。

在 KernelBench 基准测试上,CUDA Agent 取得了 SOTA 的成绩:在 Level-1、Level-2 和 Level-3 三个划分上,相比 torch.compile 分别实现了 100%、100% 和 92% 的加速比例(faster rate)。

CUDA Agent 与 torch.compile 和强大的专有模型在 KernelBench 上的对比。

简而言之,CUDA Agent是一个大规模的智能体强化学习系统,包含三个核心组成部分:可扩展的数据合成机制、一个集成技能增强且具备可靠验证与性能分析能力的 CUDA 开发环境,以及用于稳定长上下文训练的强化学习算法技术。

此外,研究团队同时发布了CUDA-Agent-Ops-6K,一个经过严格筛选与数据污染控制的高质量合成训练数据集,可支持基于强化学习的 CUDA 内核优化研究的复现。

系统管线设计

数据合成

研究团队通过一个三阶段的管线来构建训练任务:种子问题爬取、基于 LLM 的组合式合成,以及基于执行结果的筛选。

  • 从 torch 和 transformers中挖掘种子算子。每个算子都以一个 Python 类的形式表示,包含初始化和前向传播方法。
  • 在组合式合成阶段,最多采样 5 个 torch 算子,并将它们按顺序组合,构造成融合任务。
  • 筛选阶段仅保留那些在 eager 模式和 compile 模式下都能正常运行的任务,同时移除包含随机性的算子。
  • 为防止「投机取巧」,剔除在不同输入下输出为常数或无法区分的任务。
  • 在工作负载控制方面,将 eager 模式下的运行时间限制在 1ms–100ms 区间内,并移除与 KernelBench 高度相似的样本。

三阶段数据收集管线

最终整理得到 6000 条训练样本,构建了 CUDA-Agent-Ops-6K 数据集,该数据集专为可扩展的强化学习训练而设计,兼具广泛的任务多样性和较低的数据污染风险。

智能体环境

智能体循环管线遵循一种 ReAct 风格的工作流,结合代码工具与 CUDA Skill 规范(SKILL.md),支持迭代式的编码-编译-调试循环,以及基于性能分析器的优化过程。

  • 标准工作流程:对原生 PyTorch 实现进行性能分析,编写 CUDA 内核及其绑定代码,在 GPU 沙盒环境中完成编译,并不断迭代优化。
  • 目标要求:通过正确性检查,并在性能上相对于 torch.compile 实现超过 5% 的加速。
  • 稳健的奖励机制采用基于里程碑的离散奖励设计,根据正确性达标情况和性能提升幅度分别给予奖励。
  • 防止奖励作弊的控制措施包括:对验证与性能分析脚本进行保护,禁止回退调用,采用 5 组不同输入进行正确性检查,在同步预热后进行性能分析,以及禁止网络检索。

这些约束共同构建了可靠的、基于真实执行结果的反馈机制,使策略学习聚焦于内核质量的实质性提升,而非依赖取巧或捷径行为。

训练流程

训练过程采用分阶段设计,以稳定 CUDA 编码这一长时序强化学习任务。首先进行单轮 PPO 预热训练,随后分别初始化 actor 和 critic,最后进入完整的多轮智能体强化学习阶段。

  • 单轮预热阶段旨在提升基础的 CUDA 代码生成能力,为后续的交互式智能体训练打下基础。
  • 在 actor 初始化阶段,采用基于正向结果轨迹采样的拒绝式微调(RFT)。
  • RFT 过滤机制会剔除低效循环以及无效的工具调用模式,从而降低策略崩溃的风险。
  • critic 初始化阶段通过价值函数预训练,使得从训练早期开始,优势估计就具备较高可靠性。

借助这一多阶段训练设计,系统在长上下文设定下(最长 128k 上下文、训练阶段最多 150 轮、评估阶段最多 200 轮)依然保持稳定,从而实现持续的奖励增长。

核心实验结果

研究团队在 KernelBench 上报告了针对整体和 Level-3 拆分的完整指标,包括通过率、提速率(与 Eager 对比/与 Compile 对比)以及几何平均加速比(与 Eager 对比/与 Compile 对比)。

与强大的专有基线模型相比,CUDA Agent 在相对于 Compile 的性能优化上展现出显著优势:在整体 KernelBench 基准测试中,其相对 Compile 的加速达成率达到 96.8%,几何平均加速比为 2.11 倍

这一优势在高难度设置下尤为明显:在 Level-3 上,CUDA Agent 相对 compile 的加速达成率达到 90%,相比最强的专有基线高出约 40 个百分点;在 Level-2 的算子序列任务上,其加速达成率达到 100%,几何平均加速比达到 2.80 倍。

在 KernelBench 上的整体性能和加速指标。

本研究存在两个主要局限。

首先,此次研究未将 CUDA Agent 与更为复杂的编译器框架(如 TVM)进行对比。其次,训练流程依赖于大规模 GPU 资源池以及进程级隔离机制,这带来了相当可观的计算与工程成本。探索更加资源高效的训练策略,将是未来的重要研究方向。

看起来,CUDA Agent 等技术的出现即将打破传统编译器(如torch.compile或Triton)的优化瓶颈。它证明了:大语言模型不仅可以学习人类自然语言和高级编程语言,还可以通过基于硬件反馈的强化学习,内化出极高门槛的「硬件直觉」。

一条通向全自动、高度性能优化计算基础设施的道路正在出现。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
沙特王储谴责以色列暴行,呼吁寻求持久的政治解决方案

沙特王储谴责以色列暴行,呼吁寻求持久的政治解决方案

澎湃新闻
2026-10-04 15:31:27
国足VS塔吉克斯坦:蒋光太坐镇,高天意+韦世豪领衔,赵松源冲锋

国足VS塔吉克斯坦:蒋光太坐镇,高天意+韦世豪领衔,赵松源冲锋

零度眼看球
2026-10-05 13:36:44
0-3!大崩盘!被誉为“史上最强U17国足”2连败,输球原因曝光!

0-3!大崩盘!被誉为“史上最强U17国足”2连败,输球原因曝光!

大秦壁虎白话体育
2026-10-05 09:36:10
歼-16出山,让以色列倒了大霉,法国宣布重大决定,埃及成为赢家

歼-16出山,让以色列倒了大霉,法国宣布重大决定,埃及成为赢家

利刃号
2026-09-30 21:58:09
东航为何总在员工尊严与“零投诉”间纠结?

东航为何总在员工尊严与“零投诉”间纠结?

小眼睛小世界
2026-10-05 07:15:24
298克揣进裤兜的“掌机”:iQOO Pad Ultra 深度体验报告

298克揣进裤兜的“掌机”:iQOO Pad Ultra 深度体验报告

TechWeb
2026-10-03 00:04:16
红色街区焕发新活力(赓续长征精神 奋进复兴征程·记者再走长征路)

红色街区焕发新活力(赓续长征精神 奋进复兴征程·记者再走长征路)

人民资讯
2026-10-05 06:33:15
中国将迎来前所未有的死亡高峰,专家得出答案:是这些因素导致的

中国将迎来前所未有的死亡高峰,专家得出答案:是这些因素导致的

混沌录
2026-05-28 22:53:01
网上遍地A8大佬?南京真实数据直接打脸,别再被忽悠了

网上遍地A8大佬?南京真实数据直接打脸,别再被忽悠了

花小猫的美食日常
2026-10-04 01:10:28
韩乔生谈“王楚钦3银成绩登海报”:这有啥争议的?

韩乔生谈“王楚钦3银成绩登海报”:这有啥争议的?

观察者网
2026-10-04 19:46:08
萨姆纳或季前赛报销!初步伤情出炉,宏远恐单外援开局,陈老板需拍板!

萨姆纳或季前赛报销!初步伤情出炉,宏远恐单外援开局,陈老板需拍板!

体坛卡卡说
2026-10-05 16:00:28
法国政客:中国冲击欧洲工业,我们的儿孙不能都给中国人端茶送水 !

法国政客:中国冲击欧洲工业,我们的儿孙不能都给中国人端茶送水 !

52赫兹实验室
2026-10-02 15:29:52
逼空姐下跪男乘客迎来3大噩耗,正脸、身份被扒,这下傲慢不了了

逼空姐下跪男乘客迎来3大噩耗,正脸、身份被扒,这下傲慢不了了

笑一个吧
2026-10-05 14:10:54
徐良演唱会送观众泡泡机,大额订单盘活小工厂,泡泡机厂员工:公司原定9月底解散,仅剩2名员工,徐良无意间让我们重获生机

徐良演唱会送观众泡泡机,大额订单盘活小工厂,泡泡机厂员工:公司原定9月底解散,仅剩2名员工,徐良无意间让我们重获生机

极目新闻
2026-10-04 17:52:05
吴石夫人被谷正文带回家,出门后招供不断,连毛人凤都觉得细思极恐!

吴石夫人被谷正文带回家,出门后招供不断,连毛人凤都觉得细思极恐!

雍亲王府
2026-10-03 13:45:19
和普京闭门会后,俄富豪向国库交了4710亿卢布,比政府向大企业加税收的钱还多

和普京闭门会后,俄富豪向国库交了4710亿卢布,比政府向大企业加税收的钱还多

桂系007
2026-10-04 23:31:27
刘思齐晚年坦白:毛岸英入朝之前,曾反复问过毛主席一个问题!

刘思齐晚年坦白:毛岸英入朝之前,曾反复问过毛主席一个问题!

凡人侃史
2026-10-04 17:37:32
1981年李作鹏受审!当庭死磕,坚决不认两条重罪

1981年李作鹏受审!当庭死磕,坚决不认两条重罪

一切皆可能
2025-04-06 04:11:08
女护士被领导多次发生关系,苦苦哀求:你年纪大,别再找我好不好

女护士被领导多次发生关系,苦苦哀求:你年纪大,别再找我好不好

情感艺术家
2026-09-07 16:23:14
公路车骑行服,熟女骑行穿搭,利落面料勾勒饱满曲线

公路车骑行服,熟女骑行穿搭,利落面料勾勒饱满曲线

只要高兴就好
2026-09-24 11:58:50
2026-10-05 17:31:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14123文章数 142744关注度
往期回顾 全部

科技要闻

DeepSeek Harness国庆假期上新!

头条要闻

抓捕缅北"四大家族"重要成员过程披露 中方只用10分钟

头条要闻

抓捕缅北"四大家族"重要成员过程披露 中方只用10分钟

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永事件发酵!品牌火速切割

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

数码
艺术
本地
家居
公开课

数码要闻

最早发布却最难见到!英特尔Nova Lake最新爆料:BFC版本送样受到严格管控

艺术要闻

第八届山西省油画作品展 油画选(一)

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版