网易首页 > 网易号 > 正文 申请入驻

Meta没做的,英伟达做了!全新架构吞吐量狂飙6倍,20万亿Token训练

0
分享至

新智元报道

编辑:定慧

【新智元导读】英伟达发布全新架构9B模型,以Mamba-Transformer混合架构实现推理吞吐量最高提升6倍,对标Qwen3-8B并在数学、代码、推理与长上下文任务中表现持平或更优。

万万没想到,现在还紧跟我们的开源模型竟然是英伟达。

刚刚,英伟达发布了一个只有9B大小的NVIDIA Nemotron Nano 2模型。

对标的是业界标杆,千问的Qwen3-8B,但这个模型是一个完全不同的混合架构。

用英伟达的说法,这是一款革命性的Mamba-Transformer混合架构语言模型。

在复杂推理基准测试中实现了和Qwen3-8B相当或更优的准确率,并且吞吐量最高可达其6倍。

它的诞生只有一个目标:在复杂的推理任务中,实现无与伦比的吞吐量,同时保持同级别模型中顶尖的精度!

在官网简单测试一下,一些经典问题,都能答对。

英伟达还做了3个小工具,可以实时查天气、描述哈利波特里的角色和帮你想颜色。

不过9B模型还是小了点,当你问「SamAltman、马斯克和黄仁勋谁更值得信任」时,模型会犯蠢把马斯克翻译成麻克,哈哈哈。

而且,也不愧是亲儿子,模型认为黄仁勋最值得信任。

速度的奥秘

Mamba-2架构加持!

Nemotron-Nano-9B-v2的强大,源于其创新的Nemotron-H架构。

用闪电般快速的Mamba-2层,替换了传统Transformer架构中绝大多数的自注意力层。

当模型需要进行长篇大论的思考、生成复杂的长思维链时,它的推理速度得到了史诗级的提升!

简单介绍下Mamba架构

我们都知道Transformer架构,但是这么年过去,有没有新架构出现?

有的。

比如Meta公开推进JEPA(联合嵌入预测架构)和大概念模型(LCMs)、状态空间模型(就是Mamba)、记忆模型或扩散语言模型等。

谷歌DeepMind在Titans、Atlas、Genie3以及diffusion-based模型等方向投入了约50%研究力量。

OpenAI虽然嘴上说着有信心训练到GPT-8,但很可能也在储备新架构。

而根据Reddit社区的讨论,Ilya的SSI最可能就是用全新的架构,但是什么,还没人知道。

Mamba是一种完全无注意力机制的序列建模架构,基于结构化状态空间模型(SSMs)。

通过「选择性机制」根据当前输入动态调整参数,从而专注于保留相关信息并忽略无关信息。

在处理超长序列时,Mamba的推理速度据称可比Transformer快3–5倍,且其复杂度为线性级别,支持极长的上下文(甚至达到百万级token)。

为什么要混合Mamba与Transformer?

Transformer虽然效果出众,但在处理长序列时存在显著的计算和内存瓶颈(自注意力机制导致的O(n^2)规模)。

而Mamba擅长在长上下文中高效建模,但在「记忆复制(copying)」或「上下文学习(in‑contextlearning)」等任务上可能稍显不足。

从120亿到90亿的极限淬炼

NemotronNanov2的训练按照下面几个步骤:

· 「暴力」预训练

首先在一个拥有20万亿Token的海量数据集上,利用先进的FP8训练方案,锻造出一个120亿参数基础模型——Nemotron-Nano-12B-v2-Base。

这听着就非常像DeepSeek-R1:DeepSeek‑R1-Zero是直接基于DeepSeek‑V3-Base进行纯强化学习训练的初始模型。

而DeepSeek‑R1则在此基础上加入了监督微调作为冷启动,再用强化学习精炼,从而获得更好的可读性与性能。

Nemotron-Nano-12B-v2-Base的预训练,涵盖高质量网页、多语言、数学、代码、学术等数据,重点构建了高保真的数学和代码数据集。

· 极限压缩与蒸馏

结合SFT、DPO、GRPO、RLHF等多阶段对齐方法,提升了推理、对话、工具调用与安全性。

完成对齐后,祭出Minitron策略,对这个120B参数的模型进行极限压缩与蒸馏。

Minitron策略是一种由NVIDIA提出的模型压缩方法,主要通过结构化剪枝(pruning)与知识蒸馏(distillation)来实现对大型语言模型的高效压缩与性能保持。

· 最终目标

通过Minitron剪枝与蒸馏,将12B基础模型压缩为9B参数,确保单张A10GGPU(22GiB)即可支持128k上下文。

性能碾压,精度与速度全都要!

是骡子是马,拉出来遛遛!

与Qwen3-8B等同级别强手相比,Nemotron-Nano-9B-v2在各大推理基准测试中,精度平起平坐,甚至更胜一筹!

在数学(GSM8K、MATH)、代码(HumanEval+、MBPP+)、通用推理(MMLU-Pro)、长上下文(RULER128k)等基准测试中表现优于或持平同类开源模型(如Qwen3-8B、Gemma3-12B).

并在8k输入/16k输出场景下实现6.3×吞吐量提升。

全面开源

英伟达宣布在HuggingFace平台上,全面开放以下资源:

正在HuggingFace上发布以下三个模型,它们均支持128K的上下文长度:

  • NVIDIA-Nemotron-Nano-9B-v2:对齐并剪枝的推理模型

  • NVIDIA-Nemotron-Nano-9B-v2-Base:一个经过剪枝的基础模型

  • NVIDIA-Nemotron-Nano-12B-v2-Base:对齐或剪枝之前的基模型

除了模型,英伟达表示我们的数据集也很强,并开源了用于预训练的大部分数据。

Nemotron-Pre-Training-Dataset-v1数据集集合包含6.6万亿个高质量网页爬取、数学、代码、SFT和多语言问答数据的token,该数据集被组织为四个类别:

  • Nemotron-CC-v2:Nemotron-CC(Su等,2025)的后续版本,新增了八组CommonCrawl快照(2024–2025)。该数据经过全局去重,并使用Qwen3-30B-A3B进行了合成改写。此外,它还包含以15种语言翻译的合成多样化问答对,支持强大的多语言推理和通用知识预训练。

  • Nemotron-CC-Math-v1:一个专注于数学的1330亿Tokens数据集,源自NVIDIA的Lynx+LLM流水线对CommonCrawl的处理结果,该方法在将数学内容标准化为LaTeX的同时保留了公式和代码格式。这确保了关键的数学内容和代码片段保持完整,从而生成出在基准测试中优于以往数学数据集的高质量预训练数据。

  • Nemotron-Pretraining-Code-v1:一个大规模的精选代码数据集,来源为GitHub,经过多阶段去重、许可证执行和启发式质量检查筛选。该数据集还包含11种编程语言的LLM生成代码问答对。

  • Nemotron-Pretraining-SFT-v1:一个合成生成的数据集,涵盖STEM(科学、技术、工程和数学)、学术、推理及多语言领域。其中包括从高质量的数学和科学原始数据中生成的复杂选择题和分析型问题、研究生水平的学术文本,以及涵盖数学、编程、通用问答和推理任务的指令调优SFT数据。

  • Nemotron-Pretraining-Dataset-sample:数据集的一个小规模采样版本提供了10个具有代表性的子集,展示了高质量的问答数据、面向数学的抽取内容、代码元数据以及SFT风格的指令数据。

最后是感慨下,Meta作为一开始的开源旗帜,现在也逐渐开始转向闭源,或者起码是在Llama上的策略已经被调整。

目前真正在开源领域努力还是以国内的模型为主,虽然OpenAI前不久也开源了两个,不过雷声大雨点小。

英伟达虽然一直卖铲子,但也静悄悄的发布了不少开源。

感兴趣可以在如下网址体验,除了英伟达自家的,很多开源模型都能找到。

模型体验网址:

https://build.nvidia.com/nvidia/nvidia-nemotron-nano-9b-v2

参考资料:

https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
李英俊:我后来听说中国球员跳舞挑衅了;我们一定要拿金牌

李英俊:我后来听说中国球员跳舞挑衅了;我们一定要拿金牌

懂球帝
2026-09-30 18:17:24
江苏省老人退休金分6级,看懂养老金巨大差距,你属于哪档

江苏省老人退休金分6级,看懂养老金巨大差距,你属于哪档

娱乐的硬糖吖
2026-10-01 00:54:03
1955年,中央派人前往 朝鲜 挖毛岸英坟墓,可当大家刚开始挖,就突然跑过来一名妇女挡住了他们吼道:“这是我儿子的坟,你们不能迁走!”

1955年,中央派人前往 朝鲜 挖毛岸英坟墓,可当大家刚开始挖,就突然跑过来一名妇女挡住了他们吼道:“这是我儿子的坟,你们不能迁走!”

回京历史梦
2026-09-30 18:27:08
66岁刘雪华独居上海别墅,每天清晨六点,都会准时给远在加拿大的姐姐通话报平安

66岁刘雪华独居上海别墅,每天清晨六点,都会准时给远在加拿大的姐姐通话报平安

LULU生活家
2026-08-31 08:42:01
市民1.6万余元买的新手机,跑腿配送途中“消失”,货拉拉平台回应

市民1.6万余元买的新手机,跑腿配送途中“消失”,货拉拉平台回应

齐鲁壹点
2026-09-30 11:11:38
中午2点!CCTV5直播“U23历史最强国足”谢幕战,目标=拿亚运会铜牌

中午2点!CCTV5直播“U23历史最强国足”谢幕战,目标=拿亚运会铜牌

大卫的篮球故事
2026-09-30 18:50:56
外媒:王楚钦女粉丝假装残疾坐官方轮椅观赛 站起来跪地拍照+占位置

外媒:王楚钦女粉丝假装残疾坐官方轮椅观赛 站起来跪地拍照+占位置

风过乡
2026-09-30 23:26:02
10月1日起整整一个月!国家要为咱老年人办的这6件事

10月1日起整整一个月!国家要为咱老年人办的这6件事

小影的娱乐
2026-10-01 00:09:07
冲上热搜!曝C罗要求主帅公开道歉 后者发布会上食言让C罗感到背叛

冲上热搜!曝C罗要求主帅公开道歉 后者发布会上食言让C罗感到背叛

风过乡
2026-10-01 09:04:30
总统怕是当不成了,马科斯迎来最强候选人,老杜女儿已在劫难逃?

总统怕是当不成了,马科斯迎来最强候选人,老杜女儿已在劫难逃?

风雨与阳光
2026-10-01 13:49:12
问界独立运营第一车:新M8预售38.98万起 10月上市

问界独立运营第一车:新M8预售38.98万起 10月上市

爱卡汽车
2026-10-01 00:29:29
揭秘锡安变瘦内幕!专家全方位改善身体状态 新赛季出勤率令人期待

揭秘锡安变瘦内幕!专家全方位改善身体状态 新赛季出勤率令人期待

罗说NBA
2026-10-01 07:06:57
为什么妙瓦底电诈势力总是打而不绝?

为什么妙瓦底电诈势力总是打而不绝?

风铃草语
2026-10-01 08:05:01
原来,刘欢上奥运会先签保密协议,违约就赔100万,老婆都不能讲

原来,刘欢上奥运会先签保密协议,违约就赔100万,老婆都不能讲

谢葥邮轮摄影
2026-09-29 19:29:04
女优「个人DIY片」卖到翻!零成本狂捞600万月收冲破1亿

女优「个人DIY片」卖到翻!零成本狂捞600万月收冲破1亿

孤独的独角兽影视
2026-10-01 09:55:13
田朴珺陪伴网红卡戴珊爬长城,全程英文交流,网友夸赞她能力强

田朴珺陪伴网红卡戴珊爬长城,全程英文交流,网友夸赞她能力强

萧狡科普解说
2026-09-30 14:29:14
重磅:乌克兰摧毁北克里米亚大桥!俄占卢甘斯克起火

重磅:乌克兰摧毁北克里米亚大桥!俄占卢甘斯克起火

项鹏飞
2026-09-30 19:27:32
22只百万龙凤镯刷屏!奚梦瑶的豪门婚姻,从来不止是靠幸运

22只百万龙凤镯刷屏!奚梦瑶的豪门婚姻,从来不止是靠幸运

市井大实话
2026-10-01 10:29:38
万米高空遭持刀刺杀,硬核机长死战到底,救下180条人命

万米高空遭持刀刺杀,硬核机长死战到底,救下180条人命

老马拉车莫少装
2026-10-01 11:06:41
“吕布跳大”候车厅火了!武汉汉口站被国庆人流填满,网友实拍:两公里堵到步行进站

“吕布跳大”候车厅火了!武汉汉口站被国庆人流填满,网友实拍:两公里堵到步行进站

火山詩话
2026-10-01 08:38:44
2026-10-01 15:08:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16322文章数 67099关注度
往期回顾 全部

科技要闻

华为Mate90系列发布,售价5999元起

头条要闻

以乘客讲述惊魂一刻:我用耳机线捆住袭击者 他很安静

头条要闻

以乘客讲述惊魂一刻:我用耳机线捆住袭击者 他很安静

体育要闻

30天30队·火箭:乌度卡的控制欲

娱乐要闻

宋佳二封金鹰视后 内娱奖项史即将改写

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

燃油车的最佳平替 长城大狗HEV简单好开更经济

态度原创

游戏
艺术
本地
教育
公开课

曝《宝可梦 红宝石》要登陆NS2!10月8日就发售

艺术要闻

吴冠中最后一回野外油画写生,2875万!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

教育要闻

有没有逻辑思维比较强的,请指点迷津

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版