网易首页 > 网易号 > 正文 申请入驻

英伟达发布Nemotron-Flash:以GPU延迟为核心重塑小模型架构

0
分享至

导读 过去两年,小语言模型(SLM)在业界备受关注:参数更少、结构更轻,理应在真实部署中 “更快”。但只要真正把它们跑在 GPU 上,结论往往令人意外 —— 小模型其实没有想象中那么快。

参数缩小了,延迟却常常没有同步下降;结构轻量化了,吞吐却未必提升。这并非个别模型的问题,而是小模型设计长期忽略了一个根本事实:“模型更小” 并不等于 “延迟更友好”。

英伟达研究院就是从这一盲区重新出发:不是把大模型简单缩小,而是把 “真实 GPU 延迟” 作为结构设计的第一原则,全面重构小模型应该长成的样子。最终构建的 Nemotron-Flash 模型同时实现了 SOTA 准确率、低延迟、高吞吐,打败了众多业界小模型。Nemotron-Flash 已集成进 TensorRT-LLM,单 H100 GPU 吞吐可达 41K tokens/second。

该论文已被 NeurIPS 2025 接收,相关海报将于 12 月 4 日在 San Diego 展示。

  • 论文链接:https://arxiv.org/pdf/2511.18890
  • Hugging Face:

https://huggingface.co/nvidia/Nemotron-Flash-1B

https://huggingface.co/nvidia/Nemotron-Flash-3B

https://huggingface.co/nvidia/Nemotron-Flash-3B-Instruct

一、小模型为何不够快?

真正跑在 GPU 上之后,一切才暴露

英伟达的分析揭示:小模型之所以不快,是三个长期被忽视的因素造成的:

首先,是深宽比本身就是一个矛盾体。等参数比较时,模型越深往往越强;但在真实 GPU 上,延迟对 “层数” 极为敏感:层越多,kernel 调度越频繁,延迟就越高。结果是一个反直觉的事实:想强要变深,想快要变宽。而大多数小模型都深而窄,自然在延迟上吃亏。

其次,Attention 成本依然是实现高吞吐的最大瓶颈。然而业界对 Mamba2、DeltaNet 等高效算子的组合方式一直缺乏系统方法:哪些层该用 Attention,哪些层应该交给 Linear Attention?没有明确答案。

最后,小模型训练在后期往往会 “提前退场”。权重尺度逐渐偏移、有效梯度下降、模型停滞不前 —— 结构设计再好,容量也无法充分释放。许多小模型的最终性能其实被训练本身限制住了,而不是被参数量限制。

英伟达正是从这三点出发,重新回答了 “小模型应该长成什么样” 这一根本问题。

二、Nemotron-Flash 的核心方法

从延迟重新定义小模型结构

Nemotron-Flash 的方法论围绕三个关键突破展开,每一个都基于真实 GPU 延迟,而非理论 FLOPs。

1. 深宽比优化:深度负责能力,宽度负责速度,关键是找到黄金点

Nemotron-Flash 的大量真实设备实验揭示了小模型容易被忽略的规律:等参数下,越深越强;等延迟下,越宽越快。这两者天然冲突,意味着:深宽比不是一个随手调的超参,而是决定小模型最终能力和延迟的核心结构维度。

通过绘制 “准确率–延迟” 曲线,以及拟合准确率和模型深度 / 宽度的 scaling law,英伟达最终找到一个稳定的结论:模型必须 “足够深” 才能保住表达能力;也必须 “足够宽” 才能降低实际延迟;最优结构正是深宽交汇的黄金点。Nemotron-Flash-1B/3B 就是根据这套规律得到的结构,因此既不 “深得拖速度”,也不 “宽得能力不足”。

2. 混合算子结构:真正的速度来自 “谁和谁搭配”,而不是单一的替代

Nemotron-Flash 的结构创新并不是简单 “换上新算子”,而是为不同算子明确角色分工,并系统探索它们的最佳协作方式。英伟达先研究了各类算子的准确率–延迟 trade-off,据此构建搜索空间,再使用遗传算法寻找算子在不同层之间的最优比例与位置。最终得到的架构由 Attention、Mamba2、DeltaNet 和 FFN 共同组成,各自承担不同职责:

  • Attention 负责全局依赖,但必须谨慎控制数量与位置。
  • Mamba2、DeltaNet 等 Linear Attention 负责高吞吐的局部建模,是速度的主力层。
  • FFN 提供稳定的表达容量,是所有 block 的基础骨架。

Nemotron-Flash 的结果显示,小模型的能力和速度不取决于某个 “更好的” 算子,而取决于算子之间的协作模式。这进一步证明:面对真实延迟优化时,混合架构往往比任何单一结构更具优势。

3. Weight Normalization:让小模型在训练后期不再 “掉链子”

英伟达观察到,小模型训练后期权重矩阵内部会逐渐形成 structured outliers:随着训练推进,部分行或列会系统性地放大,出现远高于整体分布的大幅值结构,成为随着优化过程累积产生的 “结构化巨权重”。问题在于:这些巨权重会拖慢乃至冻结训练后期的进展。 当某些方向的权重范数过大时,反向传播的梯度在这些方向上被不断缩放,导致 effective learning rate 急剧下降。模型看似还在更新,但实际已经 “踩不动油门”,无法继续提升。

Nemotron-Flash 的解决方案非常直接有效:在训练过程中的每个 training iteration 后,对每个线性层施加显式 weight normalization,即将模型权重投影到单位范数球面上。这一归一化步骤去除了径向分量,使更新主要发生在角度方向。在相同梯度幅度下,这会带来更大的相对权重变化。

效果立竿见影:训练后期梯度不再被巨权重 “吃掉”,小模型可以持续学习,不会出现常见的 “后期停滞”。在各种模型上,最终收敛质量明显高于未使用 weight normalization 的基线模型。

三、Nemotron-Flash Model Family:又快又强


Nemotron-Flash 结合了上面所有技术,提供 1B 和 3B 两种模型大小。在 H100 上的实测结果显示:

  • Nemotron-Flash-1B 相比 Qwen3-0.6B,准确率提升 5.5%,端侧推理延迟(batch size=1)快 1.9×,最大吞吐高出 45.6×;
  • Nemotron-Flash-3B 相比 Qwen2.5-3B 与 Qwen3-1.7B,准确率提升 2%~5.5%,端侧推理延迟(batch size=1)快 1.3×~1.7×,最大吞吐提升 6.4×~18.7×;Instruct 版本同样领先,准确率提升约 4.7%,吞吐最高可达 18.7×。

Nemotron-Flash 的速度与稳定性让小模型真正具备 “可规模部署” 的能力,能够在关键业务场景中提供持续、可靠且低延迟的体验 —— 例如在高并发在线服务 中(如搜索助手、智能客服),更快的响应与更高吞吐意味着同样的 GPU 可以服务更多用户且体验更顺滑;在端侧与边缘设备 上(如家用机器人、可穿戴 XR),Nemotron-Flash 的宽结构与高速算子让设备在有限算力下依然能保持实时反应;而在成本敏感的企业私有化部署 场景(如金融、医疗),Nemotron-Flash 是既省成本又能落地高质量 AI 功能的理想选择。

结语

小模型的未来不是 “更小”,而是 “更快、更稳、更强”。Nemotron-Flash 提供了小模型设计的新底层逻辑:深宽比必须围绕延迟设计;算子组合必须有角色分工;训练必须保持后期稳定性。通过这套方法,小模型摆脱了 “虽然小但不快” 的悖论,真正实现了:小而强,小而快,小而可用。

作者简介

文章第一作者为 Yonggan Fu (傅泳淦),目前为英伟达研究院科学家。2025 年 5 月于 Georgia Institute of Technology 获博士学位,2019 年毕业于中国科学技术大学少年班学院,双修应用物理与计算机科学。博士期间获得 IBM PhD Fellowship 及 ML & Systems Rising Stars 2023。目前研究方向为高效大模型架构与算法。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
因产生分歧 美国反华议员科顿被特朗普“开盒”

因产生分歧 美国反华议员科顿被特朗普“开盒”

看看新闻Knews
2026-10-04 23:35:41
彻底扛不住了!首都全面瘫痪,菲律宾放下身段紧急求助中国

彻底扛不住了!首都全面瘫痪,菲律宾放下身段紧急求助中国

低调看天下
2026-10-04 17:57:56
军事上不如彭德怀,政治上不及周恩来,他凭什么成了国家核心领导

军事上不如彭德怀,政治上不及周恩来,他凭什么成了国家核心领导

温读史
2024-11-26 14:03:59
她曾是东方卫视台柱子,离婚后独自带儿子生活,如今沦落到卖水果

她曾是东方卫视台柱子,离婚后独自带儿子生活,如今沦落到卖水果

莹莹的历史说
2026-10-05 06:38:32
牡丹花下死?古柯再曝刘晓庆猛料,庆奶发声,没把前助理放眼里

牡丹花下死?古柯再曝刘晓庆猛料,庆奶发声,没把前助理放眼里

汪镛的创业之路
2026-08-11 17:55:59
痛心!38岁江苏美女教师梁娇去世,丈夫去世不到百天,女儿才7岁

痛心!38岁江苏美女教师梁娇去世,丈夫去世不到百天,女儿才7岁

云舟史策
2025-06-23 09:35:09
中美局势或许发生大反转,最先超过美国的,居然可能不是经济

中美局势或许发生大反转,最先超过美国的,居然可能不是经济

乌克兰小静
2026-10-05 09:09:58
徐巧芯为蔡康永解释,蒋万安发出邀请,郑丽文回应来了。

徐巧芯为蔡康永解释,蒋万安发出邀请,郑丽文回应来了。

经点星娱
2026-10-05 18:06:53
上海老师泰国失联七天,精心编织谎言独自出境,定位却身现缅甸

上海老师泰国失联七天,精心编织谎言独自出境,定位却身现缅甸

伴史缘
2026-10-05 09:14:53
人社部完成一件大事,后续工作重点会放到养老金调整上吗?

人社部完成一件大事,后续工作重点会放到养老金调整上吗?

王五说说看
2026-10-05 08:48:23
快讯!杨兰兰不简单呀!

快讯!杨兰兰不简单呀!

故事终将光明磊落
2026-10-05 12:55:20
中俄再突发大事件!普京还没踏上访华飞机,俄远东港口全线堵完?

中俄再突发大事件!普京还没踏上访华飞机,俄远东港口全线堵完?

涵豆说娱
2026-10-06 00:17:08
开国上将晚年坦言:别再骂李德无能,草地分兵他救了红军

开国上将晚年坦言:别再骂李德无能,草地分兵他救了红军

利刃说史
2026-10-05 13:00:00
中国人可以笑了!名古屋亚运会结束,不得不承认的几个事实!

中国人可以笑了!名古屋亚运会结束,不得不承认的几个事实!

神牛
2026-10-05 10:02:10
生姜立大功?美国研究发现:生姜可在48小时内清除50%老化细胞?

生姜立大功?美国研究发现:生姜可在48小时内清除50%老化细胞?

39健康网
2026-10-03 20:03:44
深圳女子花250万退休金入股保险,10年后得到的本息让她愣住了

深圳女子花250万退休金入股保险,10年后得到的本息让她愣住了

流萤叙情
2025-05-14 16:59:40
中美税收对比:美国一年税收5.2万亿美元,我国全年税收是多少?

中美税收对比:美国一年税收5.2万亿美元,我国全年税收是多少?

一些小事
2026-10-05 05:45:44
33岁章泽天风格大变!穿艳俗纱裙、副乳突出,比实际年龄成熟10岁

33岁章泽天风格大变!穿艳俗纱裙、副乳突出,比实际年龄成熟10岁

阿讯说天下
2026-04-18 14:53:39
钱再多又有什么用?演员刘涛近况曝光,给所有中老年人提了个醒

钱再多又有什么用?演员刘涛近况曝光,给所有中老年人提了个醒

深析古今
2026-10-05 18:06:06
4.1万人投票!2.8万人认为王楚钦不该登上海报 媒体:输了不躲

4.1万人投票!2.8万人认为王楚钦不该登上海报 媒体:输了不躲

念洲
2026-10-05 07:16:31
2026-10-06 05:19:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14123文章数 142744关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

孙颖莎整顿乒乓球观赛礼仪:有闪光灯、呐喊等干扰

头条要闻

孙颖莎整顿乒乓球观赛礼仪:有闪光灯、呐喊等干扰

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

亲子
游戏
教育
旅游
公开课

亲子要闻

当你有个优秀的儿子是什么感受?

XBOX要翻盘了!社区粉头盛赞三妹:纯纯实干派

教育要闻

广州大学27届保研424人:网络空间安全22.43%,隔壁计算机3.91%

旅游要闻

不止是美食打卡地,捞沙巷的前世今生,读懂老城的岁月变迁!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版