DeepSeek-V4预览版发布:支持百万令牌上下文的高效MoE模型
深度求索公司近日在arXiv预印本平台发布了DeepSeek-V4系列预览版,该系列包含两个强大的混合专家模型:参数规模达1.6万亿的DeepSeek-V4-Pro和2840亿参数的DeepSeek-V4-Flash。两款模型均支持高达100万令牌的上下文长度,在长文本处理场景中展现出卓越效率。
该系列模型在架构和优化方面进行了多项关键升级:采用结合压缩稀疏注意力与高度压缩注意力的混合注意力架构,显著提升长上下文处理效率;引入流形约束超连接技术增强传统残差连接;使用Muon优化器加速收敛并提升训练稳定性。模型基于超过32万亿高质量多样化令牌进行预训练,并通过全面的后训练流程进一步释放和增强其能力。
特别值得关注的是,DeepSeek-V4-Pro的最大推理模式在核心任务上重新定义了开源模型的性能标杆。在百万令牌上下文设置下,该系列模型相比前代DeepSeek-V3.2,单令牌推理计算量仅需27%,键值缓存减少90%,使得常规支持百万令牌上下文成为可能,为长视野任务和测试时扩展提供了更可行的技术基础。模型检查点已在Hugging Face平台开放获取。