DeepSeek开源FlashMLA解码内核,专为Hopper GPU优化

深度求索公司在其官方社交媒体宣布,于开源周首日正式开源FlashMLA解码内核。该内核专为英伟达Hopper架构GPU设计,核心优势在于对变长序列的高效解码优化,目前已在生产环境中部署使用。

FlashMLA具备多项关键技术特性:支持BF16数据格式;采用分页KV缓存技术,块大小为64;在H800 GPU上实测性能表现突出,内存带宽可达3000 GB/s,计算性能达580 TFLOPS。

此次开源是DeepSeek开源计划的一部分,开发者可通过GitHub仓库直接访问相关代码。该内核的发布有望为大模型推理部署提供更高效的解码解决方案,特别是在处理实时生成任务时能显著提升吞吐效率。

解码优化GPU加速开源模型推理部署DeepSeek

原文来源:https://x.com/deepseek_ai/status/1893836827574030466

相关阅读

深度求索预告开源周:下周将开源5个AGI探索项目
DeepSeek开源MoE通信库DeepEP,专为高效训练与推理设计
DeepSeek开源周第三弹:推出高性能FP8计算库DeepGEMM
DeepSeek API平台推出非高峰时段折扣,R1模型最高享75%优惠
DeepSeek开源周第四弹:发布V3/R1训练优化并行策略

← 返回