Kara:滑动窗口KV缓存压缩技术,大幅提升推理大模型服务效率

arXiv·18 天前

在推理语言模型生成长思维链(CoT)时,解码阶段会积累大量KV缓存,导致解码延迟高、吞吐量受限。KV缓存压缩技术通过选择性移除不重要的KV对来减少内存开销,但现有方法存在两大局限:一是阈值触发策略可能提升有限甚至降低吞吐,且可能完全清除序列某些块的KV对,加剧信息损失;二是通常只保留孤立的KV对或固定大小的块,无法灵活保存任意位置的重要语义块。

为此,研究团队提出Kara滑动窗口KV缓存压缩方法,仅在最近生成的上下文中进行解码时压缩。Kara利用双向注意力对窗口内的KV对进行评分和选择,并设计Token2Chunk模块将选中的KV对扩展为语义块,从而灵活保留重要信息。此外,团队将Kara适配至PagedAttention,开发了基于vLLM的推理框架KvLLM,有效降低KV缓存内存使用并提升输出吞吐。

实验表明,Kara与KvLLM在多种基准测试中均能实现稳定的性能提升,为高效推理大模型服务提供了新思路。

KV缓存压缩推理优化大模型服务vLLM内存效率

原文来源:https://arxiv.org/abs/2607.01237

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回