据快科技报道,4月24日,普林斯顿大学博士生Yifan Zhang在X平台公开了DeepSeek V4的完整技术规格。
DeepSeek V4将分为两个版本,完整版参数量达1.6万亿,V4 Lite参数量为2850亿。在注意力机制方面,V4采用了DSA2,融合了DeepSeek V3/R1中的DSA机制,以及今年初DeepSeek论文中提出的NSA两种稀疏注意力机制。MoE混合专家技术采用融合方案,使用Mega内核,每层384个专家,每次激活6个专家。残差连接采用此前论文中提出的Hyper-Connections,DeepGemm更新中也有提及。
在后端训练及优化方面,优化器为Muon,RL强化学习使用GRPO及KL散度修正,预训练的32K上下文最终扩展到了1M上下文。不过爆料显示V4依然是纯文本大模型,而非此前暗示的多模态模型。
需要指出的是,Yifan Zhang并非DeepSeek公司研发人员,其爆料内容真实性尚待确认,相关技术细节很多在网上已有蛛丝马迹。DeepSeek R1发布至今已超过15个月,距离V3.2最终版也过去5个月,V4面临的压力不小。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.