网易首页 > 网易号 > 正文 申请入驻

DeepSeek V4登顶了!梁文锋把四大技术秘方公开

0
分享至


智东西
作者 杨京丽
编辑 李水青

智东西4月24日报道,今天,DeepSeek-V4刚开源就迅速登顶了Hugging Face开源模型榜,相关技术报告也大方披露,覆盖华为昇腾与英伟达芯片适配、模型架构升级、预训练和后训练环节优化等丰富的技术细节,非常值得仔细品读。


DeepSeek-V4最显著的提升,除了在推理、知识、代码能力上全线抬升,整体表现比肩GPT-5.4、Claude Opus 4.6等顶级闭源模型;还在于该模型首次将“百万上下文”作为默认能力开放,在此设置下单token推理FLOPs相比DeepSeek-V3.2暴降73%,KV cache仅为其10%,大幅降低使用成本。

基础设施方面,DeepSeek-V4从训练到推理的全链路,已经完整适配了华为昇腾NPU,其自研的细粒度专家并行方案“MegaMoE”,能够在NVIDIA GPU和华为昇腾NPU上实现1.50-1.73倍的加速

DeepSeek-V4的训练过程相比前代模型有一些差异化。预训练中,DeepSeek-V4引入了“样本级注意力掩码”机制,语料总规模超过32万亿tokens,涵盖数学内容、代码、网页文本、长文档等多种高质量类别。后训练中,DeepSeek-V4则将原先的混合强化学习阶段替换为“基于策略的蒸馏”,确保训练更为可控。


开源地址:

https://huggingface.co/collections/deepseek-ai/deepseek-v4

报告地址:

https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf

一、基础设施再创新,全链路高效适配华为昇腾

DeepSeek-V4在基础设施方面提升较为明显,采用专家混合(MoE)技术,可通过专家并行化(EP)实现加速

然而,EP需要复杂的节点间通信机制,并对互连带宽和延迟提出较高要求。为缓解EP中的通信瓶颈,并在降低互连带宽需求的同时,提升端到端性能,DeepSeek提出了一种细粒度EP方案“MegaMoE”:将通信与计算功能整合为单一流水线内,实现通信与计算的重叠执行。

DeepSeek-V4在英伟达GPU和华为昇腾NPU平台上验证了细粒度专家并行(EP)方案。与性能较强的非融合基线相比,该方案在通用推理任务中实现了约1.50-1.73倍的加速,在延迟敏感的场景中最高可达1.96倍。相关CUDA实现已开源,名为MegaMoE2,作为DeepGEMM的一个组件提供。


将专家调度(Dispatch)与Linear-1重叠,将Linear-2与Combine重叠。EP方案通过将专家拆分并按波次调,实现了更细粒度的重叠。

在实际应用中,复杂的模型架构原本会生成数百个细粒度的Torch ATen运算符。为此,DeepSeek采用TileLang开发了一组融合内核,用以替代其中绝大多数运算符,把碎片化的小kernel融成大块,调用开销从百微秒压到1微秒以内,还引入Z3形式化求解器做优化验证。做到比特级可复现,同一token不管在batch哪里都得到同样结果,同一模型每次运行完全一致,这对大模型调试是保命设计。

DeepSeek将FP4(MXFP4)量化应用于两个关键部分:第一是MoE专家权重,这部分是GPU显存占用的主要来源之一;第二是CSA中索引器的Query-Key(QK)路径,在该路径中,QK激活值的缓存、加载以及乘法计算全部在FP4精度下完成,从而在长上下文场景中加速注意力分数的计算。

训练框架建立在为DeepSeek-V3开发的可扩展且高效的基础设施之上。在训练DeepSeek-V4时,DeepSeek继承了这一基础,同时引入了多项关键创新,适配其新的架构组件——包括Muon优化器、mHC,以及混合注意力机制,并在此过程中保持高效的训练效率与稳定性。


二、架构升级,突破长文本计算效率瓶颈

推理模型兴起后,业内建立了一种新的“测试时扩展”范式,显著推动了大型语言模型的性能提升。然而,这种扩展范式从根本上受限于传统注意力机制,难以处理超长上下文和复杂推理过程。

同时,从复杂智能体工作流到大规模跨文档分析,长时序任务的出现,也使得高效支持超长上下文成为未来发展的关键需求。尽管近年来一些开源工作(如DeepSeek、MiniMax、Qwen等)已经推动了模型能力的整体提升,但在处理超长序列方面的核心架构低效问题仍然存在。

DeepSeek-V4为解决这个瓶颈,它通过一系列架构创新,让模型在处理超长上下文时的计算效率大幅提升,从而真正把上下文长度推进到“百万token”这个量级。

总体而言,DeepSeek-V4系列沿用了Transformer架构和多Token预测模块,并在DeepSeek-V3基础上引入了项关键改进:

(1)采用混合注意力架构,将压缩稀疏注意力(CSA)与高压缩注意力(HCA)结合,以提升长上下文处理效率;

(2)引入流形约束超连接(mHC),增强传统残差连接;

(3)使用Muon优化器,实现更快的收敛速度和更高的训练稳定性。


具体做法上,DeepSeek-V4保留了MoE结构和多token预测策略,重点改造了注意力机制:提出一种“混合注意力”,即把两种不同的压缩方式结合起来,一种是先压缩再做稀疏注意力,另一种是更激进地压缩但仍保持稠密计算,这样在保证信息利用的同时大幅减少计算和存储开销。此外,它还改进了残差连接,增强模型表达能力,并引入新的优化器Muon,让训练更快更稳定。

除了模型结构本身,DeepSeek对整个训练和推理系统做了大量工程优化,比如把MoE的计算、通信和内存访问融合在一起执行,用专门的语言优化内核,实现可复现的计算过程,以及通过低精度(FP4)来减少资源消耗。在推理阶段,还设计了更复杂的KV cache存储方式,甚至可以部分放到磁盘上,从而支持极长上下文而不爆内存。

三、预训练:基础模型提升明显,Flash模型就已超V3.2

预训练过程主要基于DeepSeek-V3的数据,同时为构建一个更多样化、高质量且有效上下文更长的训练语料库,DeepSeek持续优化数据构建流程。与DeepSeek-V3不同的是,V4在预训练过程中引入了“样本级注意力掩码”(sample-level attention masking)机制。

对于来自网页的数据,DeepSeek-V4采用过滤策略,去除批量自动生成和模板化内容,从而降低模型崩溃的风险。数学和编程语料仍然是训练数据的核心组成部分,同时DeepSeek在中期训练阶段引入了智能体数据,进一步提升DeepSeek-V4系列的代码能力。

在多语言数据方面,DeepSeek-V4构建了更大规模的语料库,从而增强模型对不同文化中“长尾知识”的理解能力。此外,DeepSeek-V4特别强调长文档数据的构建,优先收集科学论文、技术报告等材料。

综合上述各类数据,预训练语料总规模超过32万亿tokens,涵盖数学内容、代码、网页文本、长文档等多种高质量类别。

对于基础模型的评估,DeepSeek-V4覆盖四个关键维度的基准测试,包括世界知识、语言理解与推理、代码与数学,以及长上下文处理。

DeepSeek-V3.2、DeepSeek-V4-Flash和DeepSeek-V4-Pro的基础模型在统一的内部框架下进行了评测,获得以下结果。


尽管DeepSeek-V4-Flash-Base的激活参数量和总参数量都明显更小,但它在大量基准测试中超过了DeepSeek-V3.2-Base,该优势在世界知识任务和长上下文场景中尤其明显。结果表明,DeepSeek-V4-Flash-Base在更紧凑的参数预算下,也能取得更强性能,在大多数评测中有效超过规模更大的DeepSeek-V3.2-Base。

此外,DeepSeek-V4-Pro-Base能力跃升更为明显,几乎全面领先DeepSeek-V3.2-Base和DeepSeek-V4-Flash-Base,在基准测试上刷新了DeepSeek基础模型的性能上限。它在知识密集型评测和长上下文理解能力取得了显著提升。在大多数推理和代码基准上,DeepSeek-V4-Pro-Base也超过了前两个模型。可以说,DeepSeek-V4-Pro-Base在知识、推理、代码和长上下文能力等多个方面全面超越了前代模型。

四、后训练:基于策略蒸馏,跨轮次保留推理历史

在完成预训练之后,DeepSeek还进行了后训练,最终得到DeepSeek-V4系列模型。虽然整体训练流程在很大程度上沿用了DeepSeek-V3.2的方案,但在方法上做出了一项关键替换:原先的混合强化学习(RL)阶段被完全替换为“基于策略的蒸馏”(On-Policy Distillation,OPD)。

具体做法是,先对每个目标领域各自训练一个独立的专家模型。每位专家都经历相同的流程:先用高质量领域数据做监督微调打底,再用GRPO算法做领域强化学习,这一步会得到十多位各有所长的“偏科高手”。

真正的合并动作发生在第二阶段。DeepSeek-V3.2的做法是把各类数据混在一起做RL,容易互相影响,而V4则换成让统一的学生模型自己采样答题,过程中由这十多位专家老师在完整词表的logit层面打分对齐,用reverse KL损失把学生拉向老师。这种方式保证模型在每个领域的专长都能被完整保留。另外一个关键改动是DeepSeek-V4坚持做全词表蒸馏,进而梯度更稳,训练曲线更可控,但工程难度更高。

依托DeepSeek-V4系列的一百万 token上下文窗口,DeepSeek进一步优化机制,以最大化智能体环境中交错思考的效果。


工具调用场景中,所有推理内容都会在整个对话过程中被完整保留。不同于DeepSeek-V3.2会在每一轮新用户输入到来时丢弃思考轨迹,DeepSeek-V4系列会跨越所有轮次保留完整的推理历史,让模型能够在长周期智能体任务中维持连贯、持续累积的思考链条。

一般对话场景中,DeepSeek-V4仍然保留原有策略:当新的用户消息到来时,会丢弃上一轮的推理内容,从而保持上下文简洁。

与DeepSeek-V3.2一样,那些通过用户消息来模拟工具交互的智能体框架(例如 Terminus)可能不会触发工具调用上下文路径,因此也可能无法受益于增强后的推理持久化机制。对于这类架构,DeepSeek仍然建议使用非思考模型

五、知识、推理、代码三线抬升,开源模型逼近闭源上限

评测结果上看,DeepSeek-V4-Pro-Max相比其他开源模型也略有领先,部分能力逼近闭源模型。

知识能力和推理能力上,DeepSeek-V4-Pro-Max相比其他开源模型略有领先,但仍逊于闭源模型Gemini 3.1-Pro。推理能力上,DeepSeek-V4-Pro-Max优于GPT-5.2和Gemini-3.0-Pro,落后于GPT-5.4和Gemini-3.1-Pro;DeepSeek-V4-Flash-Max与GPT-5.2和Gemini-3.0-Pro能力近似,在复杂推理任务中展现出很高的性价比。

Agent能力方面,DeepSeek-V4-Pro-Max与Kimi-K2.6和GLM-5.1等领先开源模型表现相当,但略逊于最前沿的闭源模型。长上下文能力方面,DeepSeek-V4-Pro-Max在合成任务和真实应用场景中均表现强劲,在学术基准测试中甚至超过了Gemini-3.1-Pro。


在DeepSeek-V4-Pro与DeepSeek-V4-Flash的对比中,由于参数规模较小,DeepSeek-V4-Flash-Max在知识类评测中的表现略低。但在给予更多推理token时,在推理任务中的表现可以接近DeepSeek-V4-Pro-Max。在智能体评测中DeepSeek-V4-Flash-Max在部分基准上可以达到与DeepSeek-V4-Pro-Max相当的水平,但在更复杂、高难度任务中仍略逊一筹。

结语:高效支持百万级token上下文,后续需简化架构

DeepSeek-V4系列预览版突破了超长上下文处理中的效率瓶颈,其通过融合CSA与HCA的混合注意力架构,并结合系统级基础设施优化,使模型能够更高效地支持百万token级上下文,为测试时扩展、长时序任务和在线学习等方向提供了基础。

从评测结果看,DeepSeek-V4-Pro-Max在开源模型中表现突出,在知识、推理和智能体任务上均取得较强结果,部分能力接近前沿闭源模型。DeepSeek-V4-Flash-Max则在较低成本下实现了较强推理能力,体现出较高性价比。

不过,DeepSeek-V4的架构也较为复杂,部分稳定性方法如Anticipatory Routing和SwiGLU Clamping的机理仍有待进一步理解。后续工作预计将集中在简化架构、提升训练稳定性、探索更多稀疏化方向、降低长上下文推理延迟、增强多轮智能体与多模态能力,以及持续改进数据构建与合成策略等方面。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
全网愤怒的“土豆红烧肉”事件:远离你身边的“伪人朋友”

全网愤怒的“土豆红烧肉”事件:远离你身边的“伪人朋友”

小椰子专栏
2026-09-19 13:05:12
十几亿工厂被烧毁的热议背后:月薪三千,凭什么让派遣工拼命?

十几亿工厂被烧毁的热议背后:月薪三千,凭什么让派遣工拼命?

娱乐圈见解说
2026-09-20 00:22:02
亚运会开幕式太诡异,日本又玩砸了!伊朗提前离场,退场秩序混乱

亚运会开幕式太诡异,日本又玩砸了!伊朗提前离场,退场秩序混乱

十点街球体育
2026-09-19 22:30:53
0-3!英超卫冕冠军爆冷崩盘 开局7连胜终结+丢榜首 憾失123年神迹

0-3!英超卫冕冠军爆冷崩盘 开局7连胜终结+丢榜首 憾失123年神迹

我爱英超
2026-09-20 00:11:29
美国太强大了!核电今年集中爆发,要像造车一样成为流水线

美国太强大了!核电今年集中爆发,要像造车一样成为流水线

爆角追踪
2026-09-19 16:30:02
凌晨一点的北京家属院里,72岁的濮存昕用一根绳子,将自己与94岁患阿尔茨海默症的母亲紧紧系在一起

凌晨一点的北京家属院里,72岁的濮存昕用一根绳子,将自己与94岁患阿尔茨海默症的母亲紧紧系在一起

笨鸟摘文
2026-09-19 21:35:47
进口垄断彻底终结?挪威三文鱼空运到中国的时代,正在加速落幕

进口垄断彻底终结?挪威三文鱼空运到中国的时代,正在加速落幕

抽象派大师
2026-09-17 14:33:45
举全国之力,陪一人演戏

举全国之力,陪一人演戏

老达子
2026-09-19 06:30:03
九旬老人下公交车后原地站了几秒,被突然关闭的车门刮倒摔成十级伤残,起诉索赔16.6万余元,法院:公交公司承担全部赔偿责任

九旬老人下公交车后原地站了几秒,被突然关闭的车门刮倒摔成十级伤残,起诉索赔16.6万余元,法院:公交公司承担全部赔偿责任

扬子晚报
2026-09-20 07:16:11
5年3.6亿美元!一个前无古人的NBA纪录诞生了

5年3.6亿美元!一个前无古人的NBA纪录诞生了

篮球大视野
2026-09-19 11:36:37
50岁马伊琍被曝有新恋情,和神秘男约会被拍,两人坐姿过于亲密!

50岁马伊琍被曝有新恋情,和神秘男约会被拍,两人坐姿过于亲密!

小嵩
2026-09-20 08:40:52
十二天屠城七十万,却被专家吹捧为千古完人、民族英雄,实在可笑

十二天屠城七十万,却被专家吹捧为千古完人、民族英雄,实在可笑

小豫讲故事
2026-09-20 06:00:17
从这两条“荒诞”新闻,看清了普通人最无力的悲哀

从这两条“荒诞”新闻,看清了普通人最无力的悲哀

清书先生
2026-09-19 16:53:53
蒋锋任无锡市委书记

蒋锋任无锡市委书记

扬子晚报
2026-09-19 21:10:10
菲律宾急得跳脚!平陆运河刚通航,菲代表团就来了,中方正式摊牌

菲律宾急得跳脚!平陆运河刚通航,菲代表团就来了,中方正式摊牌

铜臭的历史味
2026-09-20 02:55:39
伊朗这一仗打下来,其实留下一笔很现实的账:未来50年,中美之间爆发全面战争的可能性,大概率会非常低

伊朗这一仗打下来,其实留下一笔很现实的账:未来50年,中美之间爆发全面战争的可能性,大概率会非常低

扶苏聊历史
2026-09-19 16:31:41
永别了,娱乐圈的“三聚氰胺”!

永别了,娱乐圈的“三聚氰胺”!

断翼的鸟儿
2026-09-18 14:22:10
西贝被曝将彻底倒闭:贾国龙将揽下绝大部分债务,放弃股份

西贝被曝将彻底倒闭:贾国龙将揽下绝大部分债务,放弃股份

DoNews
2026-09-19 15:08:08
口角变群架!昆山电子厂群殴事件:线长带3名亲属参战,5人全部被开除无补偿

口角变群架!昆山电子厂群殴事件:线长带3名亲属参战,5人全部被开除无补偿

火山詩话
2026-09-20 05:47:12
审美翻车了!名古屋亚运举牌引导员出圈,引发集体吐槽:是松弛感还是太随意?

审美翻车了!名古屋亚运举牌引导员出圈,引发集体吐槽:是松弛感还是太随意?

火山詩话
2026-09-20 06:55:31
2026-09-20 10:04:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12622文章数 117170关注度
往期回顾 全部

科技要闻

谷歌承认:AI模型“黑”进3家公司

头条要闻

牛弹琴:中东传来一个好消息 美国真打不下去了

头条要闻

牛弹琴:中东传来一个好消息 美国真打不下去了

体育要闻

2026亚运会开幕式 胡明轩吴愉担任旗手

娱乐要闻

郭麒麟瘦到全网认不出,为新剧塑形

财经要闻

伪造票据洗白药品 回流药黑色产业链曝光

汽车要闻

大五座布局 车身尺寸不变 吉利银河M8申报信息公布

态度原创

游戏
时尚
教育
旅游
公开课

《宝可梦GO》联动欧洲航天局推出太空主题活动

伊姐周六热推:电视剧《兰香如故》;电视剧《一瓯春》......

教育要闻

小朋友都看懵了,计算机都算不出来

旅游要闻

潍坊昌邑:博陆山千年梨园正飘香 山阳大梨等你来品尝

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版