SelKV:选择性KV缓存合并新框架,兼顾效率与精度
大语言模型(LLMs)在自回归生成文本时,其键值(KV)缓存的内存占用随上下文长度线性增长,成为主要瓶颈。现有压缩方法常采用token合并策略,但往往因 indiscriminate aggregation(无差别聚合)导致表征质量下降,并引发“注意力衰减”问题——即合并后的token在softmax中获得与单个token相同的注意力权重,尽管它们编码了多个输入信息。
针对这一挑战,研究团队提出了一种无需训练的双组件KV缓存压缩框架。第一组件采用软余弦门控机制,根据值向量相似度自适应调节合并决策:对相似度高的token进行合并,对差异显著的token则予以抑制或丢弃,从而保持语义保真度。第二组件引入注意力比例补偿机制,在解码阶段基于预填充阶段的注意力统计信息施加logit偏置,有效纠正因合并操作导致的softmax分布失衡。
在LongBench(包含16个英文数据集)上的评估显示,仅保留25% KV缓存时,该框架在代表性单次基线方法中表现出强劲的压缩性能。尤其在对分组查询注意力(GQA)模型的测试中,该方法展现出卓越的鲁棒性,几乎维持无损的生成质量。值得注意的是,在复杂的多文档问答任务中,其性能甚至超越了全缓存基线,并在10万token长度下实现了3.3倍的解码加速。