月之暗面开源FlashKDA:基于CUTLASS的高性能Delta Attention内核
人工智能公司月之暗面近日宣布开源其高性能注意力机制实现FlashKDA。该技术是基于英伟达CUTLASS库开发的Kimi Delta Attention内核,专门优化了大语言模型中的注意力计算效率。
根据官方公布的数据,FlashKDA在H20计算平台上相比现有的flash-linear-attention基线,在预填充阶段实现了1.72倍到2.22倍的速度提升。这一性能突破对于需要处理长序列输入的应用场景具有重要意义,能够显著降低推理延迟和计算成本。
值得注意的是,FlashKDA被设计为即插即用的后端组件,可以直接替代现有的flash-linear-attention实现,无需修改上层模型架构。这为开发者和研究人员提供了便利,使他们能够轻松集成这一优化技术到自己的项目中。
月之暗面已在GitHub上公开了该项目的源代码,供社区研究和使用。这一开源举措体现了公司对推动AI基础设施发展的承诺,也有助于加速注意力机制优化技术的创新和应用。