网易首页 > 网易号 > 正文 申请入驻

DeepSeek V4发布:效率大幅提升,支持华为昇腾NPU

0
分享至


中国AI明星企业DeepSeek再度推出开放权重大语言模型,声称性能可媲美西方顶尖专有大语言模型。更值得关注的是,新模型大幅降低了推理成本,并新增对华为昇腾系列AI加速器的支持。

DeepSeek V4于近日正式发布,可在Hugging Face等主流模型仓库、官方API及网页服务上下载使用,共提供两种规格。其中较小的版本为拥有2840亿参数的Flash混合专家(MoE)模型,激活参数量为130亿;较大的版本则拥有1.6万亿参数,任意时刻激活参数量为490亿。

V4-Pro在33万亿Token上完成训练,据DeepSeek官方称,该模型在其基准测试集中超越了所有开放权重大语言模型,并可与西方最顶尖的专有模型相抗衡。

当然,这些说法仍需保持审慎态度。尽管DeepSeek凭借V3和R1系列模型建立起良好口碑,让这家中国开发商广为人知,但在标准化测试中表现优异,并不意味着在实际应用中同样出色。

从模型架构来看,DeepSeek V4引入了多项创新设计,据开发者称,这些改进将显著降低模型的服务成本。

首先是推出了规模较小的Flash模型。相较于大模型,Flash模型对基础设施要求更低,能以更低成本提供更流畅的交互体验。这一策略本身并不新鲜,但对DeepSeek而言却是首次在自研模型中正式采用。

更具实质意义的变化在于注意力机制的改进。模型的注意力机制决定了它如何将输入提示转化为键值对,进而生成输出Token。DeepSeek研究团队在随新模型发布的论文中,提出了一种结合压缩稀疏注意力(Compressed Sparse Attention)与重度压缩注意力(Heavy Compressed Attention)的混合注意力机制,旨在降低推理过程中的计算量,并减少用于追踪模型状态的键值缓存(KV Cache)所占用的内存。

KV Cache的压缩效果对V4的效率至关重要——这类缓存体积通常较大,推理服务商往往需要将其卸载至系统内存或闪存以避免冷启动延迟。更高压缩率的KV Cache意味着大规模推理部署所需的内存与存储空间显著减少。

综合以上技术,V4在支持百万Token上下文窗口的同时,内存占用较DeepSeek V3.2减少了9.5至13.7倍。

为进一步压缩内存占用,DeepSeek延续了使用低精度数据类型的传统。DeepSeek V3曾是最早采用FP8精度训练的开放权重模型之一,而V4两款模型均混合使用了FP8与FP4精度,并针对MoE专家权重采用了量化感知训练(Quantization-Aware Training)。FP4相比FP8可将模型权重所需的存储空间减少约一半,是一项显著的节省,前提是能够接受精度上的一定损失。

DeepSeek的架构改进不仅限于推理端。在V4中,开发团队还引入了名为Muon的全新优化器,旨在加速训练收敛并提升训练稳定性。

自研模型适配本土硬件

此次新模型中最引人关注、却着墨不多的一点,是其运行硬件的变化。DeepSeek V3曾深度优化以适配英伟达Hopper架构GPU,而V4已通过验证,可同时运行于英伟达与华为的加速器平台之上。

DeepSeek V4的技术论文仅在文中简短提及,指出该公司已在"英伟达GPU和昇腾NPU平台上验证了其细粒度专家并行(EP)方案"。

需要明确的是,这并不意味着该模型完全由华为硬件训练完成,仅表明DeepSeek已验证华为AI加速器可用于模型推理服务。

DeepSeek有可能采用了英伟达GPU完成预训练,再以华为加速器承担强化学习阶段的任务。强化学习是一种与推理过程相近的后训练步骤,用于向模型传授新技能、行为模式及思维链推理能力。不过,该论文并未对此作出直接说明。

总体而言,推理阶段对新兴芯片厂商的准入门槛较低。此前DeepSeek曾尝试使用华为芯片进行模型训练,但据报道,受芯片质量不稳定、互联速度过慢以及软件栈不成熟等问题影响,该计划受阻,DeepSeek最终重新回归英伟达平台。

此外,V4采用4比特精度数据类型,或令部分人联想到英伟达Blackwell加速器——该产品受出口管制,不得在中国销售。但实际上,这并非必要条件。Hopper GPU虽不支持FP4硬件加速,但仍可以纯权重模式使用该数据类型。这种方式对浮点计算性能无益,却能有效降低训练与推理阶段的内存占用和带宽需求,在众多使用场景中是值得考量的权衡方案。

价格极具竞争力

DeepSeek V4目前处于预览阶段,基础版与指令微调版均可下载或通过API调用。

小参数量的Flash模型API定价为每百万输入Token 0.14美元(非缓存)、每百万输出Token 0.28美元,颇具吸引力。大参数量的Pro模型价格相对较高,分别为每百万输入Token 1.74美元、每百万输出Token 3.48美元,但与西方AI厂商的顶尖模型相比,仍属极低水平。作为参照,OpenAI的GPT-5.5定价为每百万输入Token 5美元、每百万输出Token 30美元。

Q&A

Q1:DeepSeek V4相比V3有哪些核心改进?

A:DeepSeek V4引入了多项关键改进:一是混合注意力机制,结合压缩稀疏注意力与重度压缩注意力,大幅降低推理计算量和KV Cache内存占用,内存使用较V3.2减少9.5至13.7倍;二是同时使用FP8与FP4混度精度,进一步压缩存储需求;三是引入新优化器Muon,提升训练收敛速度与稳定性;四是新增对华为昇腾NPU平台的验证支持。

Q2:DeepSeek V4支持华为昇腾NPU,是否意味着它完全在华为硬件上训练?

A:不是。DeepSeek V4的论文仅说明已在华为昇腾NPU平台上验证了模型的专家并行推理方案,并未表明整个训练过程使用华为硬件完成。有可能预训练仍依赖英伟达GPU,强化学习阶段才引入华为加速器。目前论文未就训练硬件细节作出明确说明。

Q3:DeepSeek V4的API定价和OpenAI相比有什么差距?

A:差距相当显著。DeepSeek V4 Pro版本的API定价为每百万输入Token 1.74美元、每百万输出Token 3.48美元;而OpenAI的GPT-5.5则分别为5美元和30美元。即便是DeepSeek的旗舰Pro模型,其输出Token价格也仅为GPT-5.5的约十分之一,性价比优势突出。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
爆砍45+9+7+2!23岁状元秀:我想拿MVP和总冠军

爆砍45+9+7+2!23岁状元秀:我想拿MVP和总冠军

篮球大视野
2026-08-13 13:29:40
1904年,王维勤被活剐凌迟时一张罕见留影,脸面向人群充满绝望

1904年,王维勤被活剐凌迟时一张罕见留影,脸面向人群充满绝望

小豫讲故事
2026-08-11 06:00:16
中方摊牌了,敢对购买俄油国家加关税,美必遭反制,当天就能生效

中方摊牌了,敢对购买俄油国家加关税,美必遭反制,当天就能生效

共工之锚
2026-08-13 00:14:05
王水牛事件涉事女生拼命清理账号,作为受害者也跟着一起遭殃

王水牛事件涉事女生拼命清理账号,作为受害者也跟着一起遭殃

映射生活的身影
2026-08-12 17:18:36
钱学森儿子钱永刚坦言:父亲当年要是留在美国,我的人生发展或更顺利,不至于拖到34岁才大学毕业

钱学森儿子钱永刚坦言:父亲当年要是留在美国,我的人生发展或更顺利,不至于拖到34岁才大学毕业

磊子讲史
2026-08-03 11:15:30
Shams:威少休赛期收到国王和奇才合同报价,但仍选择退役

Shams:威少休赛期收到国王和奇才合同报价,但仍选择退役

懂球帝
2026-08-13 07:51:09
黄一鸣自曝:王思聪每次约她,车费都给10万,来给5万,回再给5万

黄一鸣自曝:王思聪每次约她,车费都给10万,来给5万,回再给5万

汉史趣闻
2025-06-24 10:07:59
胡明轩领衔今晚中国男篮12人大名单,广东男篮接触新的大外,王少杰新赛季留在北控

胡明轩领衔今晚中国男篮12人大名单,广东男篮接触新的大外,王少杰新赛季留在北控

凯丰侃球
2026-08-13 14:20:48
关之琳被曝与27岁男模交往,男方已承认恋情,“奶孙恋”登顶热搜

关之琳被曝与27岁男模交往,男方已承认恋情,“奶孙恋”登顶热搜

LULU生活家
2026-08-12 20:25:35
“黄毛爸爸,酒蒙子妈妈”,上海小学生天崩开局,结局却有反转

“黄毛爸爸,酒蒙子妈妈”,上海小学生天崩开局,结局却有反转

世界圈
2026-07-21 08:00:14
苹果9月发布会倒计时:8款新品曝光,20周年全玻璃大招却黄了

苹果9月发布会倒计时:8款新品曝光,20周年全玻璃大招却黄了

智能手机那点事
2026-08-11 21:48:36
朱可夫晚年亲口承认:德军撤出莫斯科那一夜,并非俄军打赢了,是斯大林下了一道没人敢提的命令,如何在一夜之间捏碎了德军的铁血意志?

朱可夫晚年亲口承认:德军撤出莫斯科那一夜,并非俄军打赢了,是斯大林下了一道没人敢提的命令,如何在一夜之间捏碎了德军的铁血意志?

辛某人
2026-08-10 17:10:00
刘嘉玲晒侄子获奖现场照,高颜值建筑师晚辈才华出众

刘嘉玲晒侄子获奖现场照,高颜值建筑师晚辈才华出众

墨薷桃桃
2026-08-10 16:40:22
员工台风天上班临时请假1小时被重罚,公司称其未提前一天请假,人社部门:处罚行为违规,可向劳动监察部门投诉

员工台风天上班临时请假1小时被重罚,公司称其未提前一天请假,人社部门:处罚行为违规,可向劳动监察部门投诉

极目新闻
2026-08-12 21:53:12
他是上海知名主持,和潘涛是多年好友,年过6旬开始享受退休生活

他是上海知名主持,和潘涛是多年好友,年过6旬开始享受退休生活

阿讯说天下
2026-08-13 11:35:43
沙利文曾亲口认错:佩洛西2022年窜台,是一次重大战略失误

沙利文曾亲口认错:佩洛西2022年窜台,是一次重大战略失误

桑启红原
2026-07-22 10:28:57
靠严打稳不住社会,解决就业才是真正的根本

靠严打稳不住社会,解决就业才是真正的根本

华庭讲美食
2026-08-06 08:49:13
局势反转!中国队全新参赛策略,名古屋亚运商业大局失控了

局势反转!中国队全新参赛策略,名古屋亚运商业大局失控了

秋枫凋零
2026-08-13 01:18:44
伊朗强硬派担任要职,马上对中方表示:伊朗与中国有一项战略协议

伊朗强硬派担任要职,马上对中方表示:伊朗与中国有一项战略协议

李橑在北漂
2026-08-13 14:59:34
一个从中国搬回日本的日本博士,破防了

一个从中国搬回日本的日本博士,破防了

日本物语
2026-07-05 20:35:41
2026-08-13 16:11:00
至顶科技 incentive-icons
至顶科技
科技产业媒体与 AI 产业服务机构
20900文章数 49727关注度
往期回顾 全部

科技要闻

DeepSeek V4 Pro更新:性价比炸裂 仍需打磨

头条要闻

于东来宣布胖东来许昌生活广场年底关闭 周围商户发声

头条要闻

于东来宣布胖东来许昌生活广场年底关闭 周围商户发声

体育要闻

负债十几亿的联赛,还在疯狂买球星

娱乐要闻

篡改红歌已立案,郭德纲大祸临头

财经要闻

韩国可能迎来失去的三十年

汽车要闻

试了奇瑞捷豹路虎神行者8,才知道它的i-ATS有多强?

态度原创

艺术
房产
亲子
本地
公开课

艺术要闻

于小冬 2026泽库写生新作

房产要闻

投资暴跌90%!文昌楼市,正在停摆!

亲子要闻

9岁女孩确诊性早熟 医生:这些生活习惯被忽视

本地新闻

黄州一夜,苏轼写给普通人的月光

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版