网易首页 > 网易号 > 正文 申请入驻

Meta没做的,英伟达做了!全新架构吞吐量狂飙6倍,20万亿Token训练

0
分享至

新智元报道

编辑:定慧

【新智元导读】英伟达发布全新架构9B模型,以Mamba-Transformer混合架构实现推理吞吐量最高提升6倍,对标Qwen3-8B并在数学、代码、推理与长上下文任务中表现持平或更优。

万万没想到,现在还紧跟我们的开源模型竟然是英伟达。

刚刚,英伟达发布了一个只有9B大小NVIDIA Nemotron Nano 2模型

对标的是业界标杆,千问的Qwen3-8B,但这个模型是一个完全不同的混合架构。

用英伟达的说法,这是一款革命性的Mamba-Transformer混合架构语言模型。

在复杂推理基准测试中实现了和Qwen3-8B相当或更优的准确率,并且吞吐量最高可达其6倍

它的诞生只有一个目标:在复杂的推理任务中,实现无与伦比的吞吐量,同时保持同级别模型中顶尖的精度!

在官网简单测试一下,一些经典问题,都能答对。

英伟达还做了3个小工具,可以实时查天气、描述哈利波特里的角色和帮你想颜色。

不过9B模型还是小了点,当你问「SamAltman、马斯克和黄仁勋谁更值得信任」时,模型会犯蠢把马斯克翻译成麻克,哈哈哈。

而且,也不愧是亲儿子,模型认为黄仁勋最值得信任

速度的奥秘

Mamba-2架构加持!

Nemotron-Nano-9B-v2的强大,源于其创新的Nemotron-H架构

用闪电般快速的Mamba-2,替换了传统Transformer架构中绝大多数的自注意力层

当模型需要进行长篇大论的思考、生成复杂的长思维链时,它的推理速度得到了史诗级的提升!

简单介绍下Mamba架构

我们都知道Transformer架构,但是这么年过去,有没有新架构出现?

有的。

比如Meta公开推进JEPA(联合嵌入预测架构)和大概念模型(LCMs)、状态空间模型(就是Mamba)、记忆模型或扩散语言模型等。

谷歌DeepMind在Titans、Atlas、Genie3以及diffusion-based模型等方向投入了约50%研究力量。

OpenAI虽然嘴上说着有信心训练到GPT-8,但很可能也在储备新架构

而根据Reddit社区的讨论,Ilya的SSI最可能就是用全新的架构,但是什么,还没人知道。

Mamba是一种完全无注意力机制的序列建模架构,基于结构化状态空间模型(SSMs)。

通过「选择性机制」根据当前输入动态调整参数,从而专注于保留相关信息并忽略无关信息。

在处理超长序列时,Mamba的推理速度据称可比Transformer快3–5倍,且其复杂度为线性级别,支持极长的上下文(甚至达到百万级token)。

为什么要混合Mamba与Transformer?

Transformer虽然效果出众,但在处理长序列时存在显著的计算和内存瓶颈(自注意力机制导致的O(n^2)规模)。

而Mamba擅长在长上下文中高效建模,但在「记忆复制(copying)」或「上下文学习(in‑contextlearning)」等任务上可能稍显不足。

从120亿到90亿的极限淬炼

NemotronNanov2的训练按照下面几个步骤:

· 「暴力」预训练

首先在一个拥有20万亿Token的海量数据集上,利用先进的FP8训练方案,锻造出一个120亿参数基础模型——Nemotron-Nano-12B-v2-Base

这听着就非常像DeepSeek-R1:DeepSeek‑R1-Zero是直接基于DeepSeek‑V3-Base进行纯强化学习训练的初始模型。

而DeepSeek‑R1则在此基础上加入了监督微调作为冷启动,再用强化学习精炼,从而获得更好的可读性与性能。

Nemotron-Nano-12B-v2-Base的预训练,涵盖高质量网页、多语言、数学、代码、学术等数据,重点构建了高保真的数学和代码数据集。

· 极限压缩与蒸馏

结合SFT、DPO、GRPO、RLHF等多阶段对齐方法,提升了推理、对话、工具调用与安全性。

完成对齐后,祭出Minitron策略,对这个120B参数的模型进行极限压缩与蒸馏。

Minitron策略是一种由NVIDIA提出的模型压缩方法,主要通过结构化剪枝(pruning)与知识蒸馏(distillation)来实现对大型语言模型的高效压缩与性能保持。

· 最终目标

通过Minitron剪枝与蒸馏,将12B基础模型压缩为9B参数,确保单张A10GGPU(22GiB)即可支持128k上下文。

性能碾压,精度与速度全都要!

是骡子是马,拉出来遛遛!

Qwen3-8B等同级别强手相比,Nemotron-Nano-9B-v2在各大推理基准测试中,精度平起平坐,甚至更胜一筹!

在数学(GSM8K、MATH)、代码(HumanEval+、MBPP+)、通用推理(MMLU-Pro)、长上下文(RULER128k)等基准测试中表现优于或持平同类开源模型(如Qwen3-8B、Gemma3-12B).

并在8k输入/16k输出场景下实现6.3×吞吐量提升

全面开源

英伟达宣布在HuggingFace平台上,全面开放以下资源:

正在HuggingFace上发布以下三个模型,它们均支持128K的上下文长度:

  • NVIDIA-Nemotron-Nano-9B-v2:对齐并剪枝的推理模型

  • NVIDIA-Nemotron-Nano-9B-v2-Base:一个经过剪枝的基础模型

  • NVIDIA-Nemotron-Nano-12B-v2-Base:对齐或剪枝之前的基模型

除了模型,英伟达表示我们的数据集也很强,并开源了用于预训练的大部分数据。

Nemotron-Pre-Training-Dataset-v1数据集集合包含6.6万亿个高质量网页爬取、数学、代码、SFT和多语言问答数据的token,该数据集被组织为四个类别:

  • Nemotron-CC-v2:Nemotron-CC(Su等,2025)的后续版本,新增了八组CommonCrawl快照(2024–2025)。该数据经过全局去重,并使用Qwen3-30B-A3B进行了合成改写。此外,它还包含以15种语言翻译的合成多样化问答对,支持强大的多语言推理和通用知识预训练。

  • Nemotron-CC-Math-v1:一个专注于数学的1330亿Tokens数据集,源自NVIDIA的Lynx+LLM流水线对CommonCrawl的处理结果,该方法在将数学内容标准化为LaTeX的同时保留了公式和代码格式。这确保了关键的数学内容和代码片段保持完整,从而生成出在基准测试中优于以往数学数据集的高质量预训练数据。

  • Nemotron-Pretraining-Code-v1:一个大规模的精选代码数据集,来源为GitHub,经过多阶段去重、许可证执行和启发式质量检查筛选。该数据集还包含11种编程语言的LLM生成代码问答对

  • Nemotron-Pretraining-SFT-v1:一个合成生成的数据集,涵盖STEM(科学、技术、工程和数学)、学术、推理及多语言领域。其中包括从高质量的数学和科学原始数据中生成的复杂选择题和分析型问题、研究生水平的学术文本,以及涵盖数学、编程、通用问答和推理任务的指令调优SFT数据。

  • Nemotron-Pretraining-Dataset-sample:数据集的一个小规模采样版本提供了10个具有代表性的子集,展示了高质量的问答数据、面向数学的抽取内容、代码元数据以及SFT风格的指令数据。

最后是感慨下,Meta作为一开始的开源旗帜,现在也逐渐开始转向闭源,或者起码是在Llama上的策略已经被调整。

目前真正在开源领域努力还是以国内的模型为主,虽然OpenAI前不久也开源了两个,不过雷声大雨点小。

英伟达虽然一直卖铲子,但也静悄悄的发布了不少开源。

感兴趣可以在如下网址体验,除了英伟达自家的,很多开源模型都能找到。

模型体验网址:

https://build.nvidia.com/nvidia/nvidia-nemotron-nano-9b-v2

参考资料:

https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
真有飞行员这么骚的吗

真有飞行员这么骚的吗

停机坪
2026-08-05 19:32:14
张柏芝不再隐瞒,曝三胎小儿子心愿,生父谣言终结,谢霆锋心情差

张柏芝不再隐瞒,曝三胎小儿子心愿,生父谣言终结,谢霆锋心情差

草莓解说体育
2026-08-12 10:41:29
已有5个孩子的c罗结婚了,看来是真爱

已有5个孩子的c罗结婚了,看来是真爱

萱小蕾o
2026-08-12 10:21:47
离大谱!曝非洲一球员比赛中倒地被宣布死亡 送太平间路上“复活”

离大谱!曝非洲一球员比赛中倒地被宣布死亡 送太平间路上“复活”

风过乡
2026-08-12 07:36:28
为啥说百花奖已沦为“水奖”?看张艺谋发言就懂了,比票数还打脸

为啥说百花奖已沦为“水奖”?看张艺谋发言就懂了,比票数还打脸

古事寻踪记
2026-08-12 09:39:04
巴图姆谈库里"黄金匕首":全世界99.9999%的人都会投丢

巴图姆谈库里"黄金匕首":全世界99.9999%的人都会投丢

北青网-北京青年报
2026-08-11 20:51:07
再这样下去,中国烟草很可能会出问题,原因很现实

再这样下去,中国烟草很可能会出问题,原因很现实

亿通电子游戏
2026-08-11 04:09:58
中企刚被逼停,印尼矿工就烧了大楼,西方媒体却集体闭麦了

中企刚被逼停,印尼矿工就烧了大楼,西方媒体却集体闭麦了

凡知
2026-08-11 14:27:54
47岁严宽晒旧房:24年前买房8000一平,5年还清房贷,可惜早卖了

47岁严宽晒旧房:24年前买房8000一平,5年还清房贷,可惜早卖了

艺能八卦局
2026-08-11 13:00:36
22岁的程梦圆死亡真相!背包、证件散落荒草,陡峭的山崖,见证了这场猝不及防的意外

22岁的程梦圆死亡真相!背包、证件散落荒草,陡峭的山崖,见证了这场猝不及防的意外

火山詩话
2026-08-10 17:24:55
为何中国宁愿把电力输向越南,让越南夜晚灯火辉煌,却对朝鲜几乎绝不供电?这事看着奇怪,其实道理很简单!

为何中国宁愿把电力输向越南,让越南夜晚灯火辉煌,却对朝鲜几乎绝不供电?这事看着奇怪,其实道理很简单!

磊子讲史
2026-08-10 15:13:10
黄晓明新恋情持续发酵!前女友叶珂不忍了,全盘托出生娃分手原因

黄晓明新恋情持续发酵!前女友叶珂不忍了,全盘托出生娃分手原因

雅儿姐游世界
2026-08-12 09:41:16
少妇被邻居强奸拍裸照后自愿同居,情夫中40万彩票后竟被少妇夫妻联合掐死

少妇被邻居强奸拍裸照后自愿同居,情夫中40万彩票后竟被少妇夫妻联合掐死

胖胖侃咖
2026-08-10 20:00:03
55岁广东主持人:从儿科医生到主持界,貌美如花仍在岗

55岁广东主持人:从儿科医生到主持界,貌美如花仍在岗

凛若秋霜
2026-08-12 02:29:54
炸裂,中国“黄金大外环”来了,这三座城迎来泼天富贵?

炸裂,中国“黄金大外环”来了,这三座城迎来泼天富贵?

智谷趋势
2026-08-11 16:23:22
太意外了!2032奥运举办地敲定:结果惊呆众人,奥运格局大变!

太意外了!2032奥运举办地敲定:结果惊呆众人,奥运格局大变!

小涛叨叨
2026-04-22 17:06:20
《纽约时报》长文揭露美国底层现状:那些连卫生纸、理发都负担不起的美国人

《纽约时报》长文揭露美国底层现状:那些连卫生纸、理发都负担不起的美国人

极目新闻
2026-08-12 08:47:10
终于有经济学家批评体制内退休金太高、加剧代际矛盾,评论区炸锅

终于有经济学家批评体制内退休金太高、加剧代际矛盾,评论区炸锅

慧翔百科
2026-06-23 08:47:02
C罗与乔安娜低调完婚,足坛明星纷纷送祝福

C罗与乔安娜低调完婚,足坛明星纷纷送祝福

北青网-北京青年报
2026-08-12 09:13:03
榨干中国红利后投美!商务部雷霆出击,公司创始人被查大快人心!

榨干中国红利后投美!商务部雷霆出击,公司创始人被查大快人心!

米果说识
2026-08-12 10:01:43
2026-08-12 11:27:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
15919文章数 66998关注度
往期回顾 全部

科技要闻

Claude又出骚操作 改个错字也要留AI水印?

头条要闻

Manus:即将恢复以独立公司的形式运营

头条要闻

Manus:即将恢复以独立公司的形式运营

体育要闻

NBA老顽童,抽着大麻喝着小酒告别了

娱乐要闻

陈思诚恋情疑云再起

财经要闻

李嘉诚,再一次大撤退!他嗅到了什么?

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

房产
时尚
旅游
本地
公开课

房产要闻

突发,崖州湾又有大动作!

百花奖,不渡85花

旅游要闻

上海人的“江南会客厅”!1400年古镇免费逛

本地新闻

黄州一夜,苏轼写给普通人的月光

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版