DeepSeek开源周第三弹:推出高性能FP8计算库DeepGEMM

在开源周第三天,DeepSeek正式推出DeepGEMM——一款专为FP8精度优化的通用矩阵乘法库。该库同时支持密集矩阵与混合专家(MoE)架构的GEMM运算,为DeepSeek最新V3/R1系列模型的训练与推理提供核心计算支持。

技术亮点方面,DeepGEMM在英伟达Hopper架构GPU上可实现超过1350 FP8 TFLOPS的峰值算力。库设计追求极简,无需复杂依赖,代码清晰度堪比教学示例。采用全即时编译技术,核心逻辑仅约300行代码,却在多数矩阵尺寸下超越专家手动优化的计算内核。

DeepGEMM目前支持密集矩阵布局及两种MoE专用数据布局,其GitHub仓库已公开,开发者可立即体验这款高性能计算工具。该库的发布体现了DeepSeek在底层计算优化方面的持续投入,为大规模AI模型的高效运行提供了新的基础设施选择。

DeepSeek计算库FP8开源高性能计算

原文来源:https://x.com/deepseek_ai/status/1894553164235640933

相关阅读

深度求索预告开源周:下周将开源5个AGI探索项目
DeepSeek开源FlashMLA解码内核,专为Hopper GPU优化
DeepSeek开源MoE通信库DeepEP,专为高效训练与推理设计
DeepSeek API平台推出非高峰时段折扣,R1模型最高享75%优惠
DeepSeek开源周第四弹:发布V3/R1训练优化并行策略

← 返回