DeepSeek今日发布V4系列旗舰大语言模型的新成员——V4 Flash Vision Exp。这款多模态模型目前仅通过该中国初创公司的付费开发者平台提供,但考虑到DeepSeek此前已开源多款早期模型,未来推出免费版本的可能性不小。
V4 Flash Vision Exp的基础是今年4月发布的V4 Flash算法。DeepSeek在七个包含文本挑战的基准测试中对比了两代模型,结果显示新模型在除Cybergym之外的所有测试中均优于前代。Cybergym基准专门评估大语言模型发现软件漏洞的能力,是唯一一个V4 Flash Vision Exp未能超越前代的领域。
![]()
图像分析是V4 Flash Vision Exp提升最明显的方向。DeepSeek使用四个不同基准测试了模型处理视觉内容的能力,其中两项测试得分提升超过10%。
更值得注意的是,V4 Flash Vision Exp在ALE和ZeroBench两个视觉基准上超越了Anthropic的Opus 4.8。ALE包含超过1000个多步骤任务,要求大语言模型与应用程序交互、编写代码并解读媒体文件;ZeroBench则包含100个被设计为对前沿大语言模型极具挑战性的图像分析任务。
架构细节:2840亿参数的混合专家模型
DeepSeek尚未公布V4 Flash Vision Exp的架构信息,但其Hugging Face页面提供了基础模型V4 Flash的详细技术概览。
V4 Flash是一个拥有2840亿参数的混合专家模型,由多个各含130亿参数的神经网络组成。当用户输入提示词时,模型仅激活最适合生成答案的神经网络,这种方案比激活整个大语言模型所需的硬件资源显著减少。
大语言模型将回答提示词所需的信息存储在KV缓存数据结构中。V4 Flash采用HCA和CSA两种技术压缩KV缓存,据DeepSeek介绍,这些技术可将处理100万token提示词所需的计算量降低73%。
训练数据与优化算法
DeepSeek使用32万亿token的训练数据训练V4 Flash,并采用名为Muon的算法加速训练流程。Muon减少了校准大语言模型隐藏层所需的时间——隐藏层是处理提示词的大部分计算组件。
V4 Flash是DeepSeek四月发布的两款大语言模型之一,另一款是参数数量超过其五倍的V4 Pro。鉴于V4 Flash Vision Exp源自V4 Flash,未来V4 Pro也有可能成为针对图像分析等任务优化的专用模型的基础。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.