LaCache框架:为扩散大语言模型实现无损缓存与自适应精度推理
近日,arXiv平台发布了一项针对扩散大语言模型(DLLMs)的优化研究。当前基于扩散的大语言模型在文本生成中采用半自回归解码实现并行生成,但存在严重的算子级冗余问题——模型在去噪步骤中会重复计算整个序列,忽略了前缀和掩码后缀在块内保持不变的事实。
为解决这一瓶颈,研究团队提出了LaCache框架,这是一个无需额外训练的加速方案。该框架通过两种核心技术实现效率提升:一是采用无损状态记忆化(LSM)机制,缓存三种中间结果——嵌入输出缓存(EmbedCache)、词元级预注意力状态缓存(RoPECache)以及FlashAttention内部的在线softmax统计缓存(FACache),使模型能够在不改变输出的情况下跳过未变化词元的冗余计算。
二是针对前馈网络层设计了按组分组的FP8量化策略,该策略根据扩散过程中不同步骤的激活分布特点进行自适应精度调整,有效缓解内存带宽瓶颈。实验表明,单独使用LaCache即可在端到端速度上实现约1.3倍提升;当与现有加速方法结合时,最高可实现40.2倍加速,同时保持与原始模型相当的任务精度。这项技术为扩散大语言模型的实际部署提供了重要的效率优化路径。