网易首页 > 网易号 > 正文 申请入驻

DeepSeek V4.1 Flash技术报告公开!KV Cache压到极限,HBM需求降至1/4

0
分享至

智猩猩AI整理

编辑:林夕

9月8日,DeepSeek在官方交流群放出V4.1 Flash中间版本内测,模型名直接写着deepseek-v4.1-flash-expires-on-0910,只开放两天。


9月9日,DeepSeek又宣布下调Flash系列API价格,并明确在V4.1 Pro发布前,所有V4 Pro请求将自动路由至V4.1 Flash,按Flash价格计费。。

9月10日,V4.1 Flash正式上线,模型权重与技术报告同步公开


随着技术报告公开,这个模型的真正看点也逐渐清晰:552B参数,却已经把能力推到了顶级开源模型的竞争区间

报告的副标题很直白: Pushing the Limits of KV Cache Compression (把 KV Cache 压缩推到极限),一份把"降本"写进标题的报告

它的开篇逻辑是:长周期智能体让模型的负载越来越输入密集型,稀疏注意力已经把长序列的计算成本降下来了,但prefill 依然昂贵,庞大的 KV Cache 持续压迫 HBM 与 SSD 的容量和数据传输带宽。

计算、存储、带宽三者叠加,构成了部署成本继续下探的主要障碍。

于是 V4.1-Flash 的全部架构改动,几乎都围绕这一个目标展开。


最终的压缩效果相当直接,全局KV Cache常驻HBM时,每个Token只需要约890字节,相比V4-Flash降至约1/4;而持久化KV Cache常驻SSD或主机内存时,进一步降至V4-Flash的约1/8

01

CED:让552B的模型

在prefill时只激活 8B

V4.1-Flash 是一个多模态 MoE 模型,语言主干共 40 层,被切成 20 层 causal encoder 加 20 层 decoder。

整体有 552B 主干参数,另加 196B Engram 参数,支持最长 100 万 token 的上下文。

关键在激活量的不对称:每 token在 prefill 阶段只激活 8B 参数,decode 阶段激活 16B。


支撑这一点的是核心设计CED(Causal Encoder-Decoder)

用 encoder 的输出直接构造 decoder 的全局 KV Cache,让大部分 prompt token 绕开完整的 decoder 计算,同时保留层内的滑动窗口注意力,报告称这几乎把 prefill 的计算量减半。

与它配合的CSA2在层与层之间共享全局 KV、复用稀疏选择结果,decoder 中还设了一层"层次稀疏索引器",让后续索引器只在前一层已选出的候选池里打分。

其余改动集中在效率与部署侧:

(1)mHC 升级为Single-Pass mHC,配套的 Mega-mHC 部署内核把激活内存流量相对原四内核实现减半;

(2)引入Engram条件记忆与DSpark推测解码;

(3)主 KV Cache 采用FP4

(4)部署侧加上SWA Bounded Replay,只重放最近的 n_win 个 token来近似重建 SWA KV 状态。

这些改动叠加之后的效果是单 token 的 Decode FLOPs 在不同上下文长度下几乎保持恒定


02

预训练:45T token,

稀疏注意力从零训起

V4.1-Flash 的预训练语料是45T token 的多模态数据集

稀疏注意力是从零开始、在 64K 序列长度上直接训练的,没有任何 dense attention 的热身阶段,视觉从零训、与语言一起进语料,旧的 Flash Vision-Exp 外挂路线被收掉。

Base 模型的对比相当有信息量。

V4.1-Flash-Base 只用约 1/3 的总参数、1/4 的激活参数,就在世界知识、推理和编程上取得了与 V4-Pro-Base 相当的水平,并在部分留出评测上提升 5%–10%。


03

后训练没有新算法,

钱都花在数据上

报告在后训练章节的开头,主动做了一个限定,本环节不引入算法创新

流程沿用监督微调、强化学习、在策略蒸馏,与 V4 开发时的成熟做法没有区别。

所有实质变化都发生在数据管线里:大规模自动化的数据合成与环境构建,以及在 RL 中持续放大的数据、任务与 rollout 规模

支撑这一规模的是DSec(DeepSeek Elastic Compute),一个面向大规模智能体训练与评测的生产级沙箱平台。

报告提到,V4.1 的训练把需求推高到了数百万并发沙箱实例,瓶颈随之转向数据中心可扩展性、工作负载隔离、单节点算力密度,以及对越来越强的智能体越界行为的约束。

另一个设计是可控制的推理强度(Controllable Reasoning Effort)

模型在训练时接受一个 1–100 的标量 effort 作为显式条件信号,写进系统提示词,让同一个 checkpoint 能在不同的成本—质量区间之间滑动。


报告还提到一条工程经验,为了把有效算力扩展到单次训练之外,他们用模型合并来重新初始化后续的 RL 轮次,把不同 scaffold 或配置下各自取得的改进合到一起。


另一条与推理成本直接相关,多智能体配置在同等截止时间下的收益,明显高于单智能体。


04

Agent 追平前沿,

长上下文仍有短板

后训练评测中,V4.1-Flash 的成绩分布并不均匀,报告本身也承认了这一点。

在智能体方向,它确实追到了前沿:Terminal-Bench 2.1 得分 90.6、DeepSWE v1.1 为 74.2、CyberGym 为 88.1、Automation-Bench 为 54.8。


在 Reasoning 与 Agentic 两大类共二十余项指标上,V4.1-Flash 与 V4-Pro、GLM-5.3、Kimi-K3 互有胜负。

Codeforces Rating 3471、MathArena Apex 65.6 属于第一梯队;GPQA Diamond 90.9、HLE 36.8 则仍与 Opus-5 的 93.4、56.3 存在差距。


模型能完成超过 95% 的真实世界任务,但在 Terminal-Bench 4.0 这类"科学导向"的智能体任务上仍有差距。

报告也主动标注了架构改动带来的鲁棒性边界,CSA2 的选择误差、SWA Bounded Replay 的近似状态重建,都可能在未经测试的边界情形下造成能力退化。

05

Flash只是开始,

V4.1 Pro或许才是下一张牌

V4.1 Flash更像是DeepSeek对下一阶段Agent模型的一次系统级试验。

552B参数只是表面,真正的核心是围绕KV Cache、Prefill和长上下文推理持续压缩成本

CED、CSA2、FP4 KV Cache以及SWA Bounded Replay等设计,把模型能力和部署效率放到了同一个优化目标里。

它目前在Agent、代码等任务上已经进入开源模型第一梯队,但长上下文和部分复杂推理仍有短板。

对DeepSeek来说,V4.1 Flash更像一个起点,后面的V4.1 Pro以及下一代模型,或许才会真正体现这套技术路线的上限。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
意料之外——成千上万荷兰基督徒在阿姆斯特丹集会支持以色列

意料之外——成千上万荷兰基督徒在阿姆斯特丹集会支持以色列

老王说正义
2026-09-19 00:47:49
2026年出生人口预测:老百姓对断绝香火危机的冷漠,官方看到都无奈

2026年出生人口预测:老百姓对断绝香火危机的冷漠,官方看到都无奈

非虚构人间
2026-09-11 01:40:57
热搜爆了!许嵩与小14岁女友官宣结婚

热搜爆了!许嵩与小14岁女友官宣结婚

观察者网
2026-09-19 21:22:15
美国批准对乌克兰近27亿美元军售

美国批准对乌克兰近27亿美元军售

新京报
2026-09-19 09:51:09
中东激战的同时,美国人猛然发现,中国在吉布提的基地变样了

中东激战的同时,美国人猛然发现,中国在吉布提的基地变样了

触摸史迹
2026-09-19 03:43:43
热搜上令人窒息的“母女吃牛肉面一幕”,精神穷人可怕的三观

热搜上令人窒息的“母女吃牛肉面一幕”,精神穷人可怕的三观

蝴蝶花雨话教育
2026-08-18 09:57:05
CCTV5+直播中国VS伊朗!安东尼奥改打541吗?还让毛伟杰打中场要凉

CCTV5+直播中国VS伊朗!安东尼奥改打541吗?还让毛伟杰打中场要凉

刀锋体育
2026-09-19 10:19:29
忍无可忍不必再忍!李在明接连三次的对华越线,中方强硬精准反制

忍无可忍不必再忍!李在明接连三次的对华越线,中方强硬精准反制

张癈卤说体育
2026-09-18 17:56:56
雷克萨斯RX卖疯了?8月干到2360台,40万开走真不是段子

雷克萨斯RX卖疯了?8月干到2360台,40万开走真不是段子

周哥一影视
2026-09-19 09:19:36
国行终于等到了!Apple Watch睡眠呼吸暂停提示获药监局批准:S9及以上可用

国行终于等到了!Apple Watch睡眠呼吸暂停提示获药监局批准:S9及以上可用

快科技
2026-09-19 14:04:09
贷款200万打NBA!现在开劳斯莱斯!

贷款200万打NBA!现在开劳斯莱斯!

柚子说球
2026-09-19 19:27:22
香港38岁男子因琐事争执袭击六旬母亲,反被母亲持刀刺伤胸部,两败俱伤双双送医,两人均被警方拘捕

香港38岁男子因琐事争执袭击六旬母亲,反被母亲持刀刺伤胸部,两败俱伤双双送医,两人均被警方拘捕

都市快报橙柿互动
2026-09-19 17:25:58
爱知·名古屋亚运会开幕,中国代表团入场引发热烈欢呼!现场图→

爱知·名古屋亚运会开幕,中国代表团入场引发热烈欢呼!现场图→

新民晚报
2026-09-19 18:18:11
比赛还没开打,皇马先迎一个好消息,雪中送炭,取胜马竞概率大增

比赛还没开打,皇马先迎一个好消息,雪中送炭,取胜马竞概率大增

零度眼看球
2026-09-19 09:24:49
豪门真难进!华晨宇给孩子做2次亲子鉴定,彻底断了张碧晨豪门梦

豪门真难进!华晨宇给孩子做2次亲子鉴定,彻底断了张碧晨豪门梦

八卦王者
2026-07-13 13:18:19
决胜局0-10落后,陈垣宇2-3川上流星止步球星挑战赛32强

决胜局0-10落后,陈垣宇2-3川上流星止步球星挑战赛32强

懂球帝
2026-09-19 00:11:09
浙江商K大面积关门:一场酒局干翻一条深夜产业链

浙江商K大面积关门:一场酒局干翻一条深夜产业链

听心堂
2026-09-19 11:51:59
罕见!深圳、广州、东莞、佛山,集体出手抢人了

罕见!深圳、广州、东莞、佛山,集体出手抢人了

城市财经
2026-09-18 11:55:09
《纽约时报》:特朗普对俄立场出现转变,有意通过经济利益,来劝说俄罗斯结束战争;去年他曾承诺,战争结束之前不会与俄达成任何商业协议

《纽约时报》:特朗普对俄立场出现转变,有意通过经济利益,来劝说俄罗斯结束战争;去年他曾承诺,战争结束之前不会与俄达成任何商业协议

报人刘亚东
2026-09-19 20:44:35
普京接班人已明朗?俄罗斯或出现史上首个,由外长接班的总统?

普京接班人已明朗?俄罗斯或出现史上首个,由外长接班的总统?

快乐彼岸
2026-09-18 20:54:42
2026-09-19 23:04:49
智猩猩
智猩猩
AI 技术内容与服务平台
139文章数 6关注度
往期回顾 全部

科技要闻

要走650亿,智谱的理想越来越贵

头条要闻

男子拿10多个西瓜连砸摊主头部 最新进展:男子赔近7万

头条要闻

男子拿10多个西瓜连砸摊主头部 最新进展:男子赔近7万

体育要闻

2026亚运会开幕式 胡明轩吴愉担任旗手

娱乐要闻

甜度爆表!许嵩冯禧晒婚纱照官宣结婚

财经要闻

江西首富破产:一张927万商票压垮千亿帝国

汽车要闻

大块头的从容 红旗G919如何兼顾豪华与越野能力

态度原创

教育
时尚
亲子
家居
手机

教育要闻

华东师范大学出版社人工智能通识课程走进江阴课堂

早秋外套别总穿黑色,准备一件黄色针织衫,温柔大方又减龄

亲子要闻

其实我们小面一出现ee们每天都在解读婴语吧!

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

华为Mate90爆料汇总!新机细节一文看懂~

无障碍浏览 进入关怀版