VarRate:无需训练即可实现KV缓存变速率压缩,提升长上下文LLM推理效率
在长上下文大语言模型推理中,键值(KV)缓存是主要的内存瓶颈。现有无需训练的压缩方法存在明显局限:令牌选择方法(如SnapKV、Ada-KV)会根据观察窗口评分淘汰低分token,但这种淘汰不可逆——当重要性信号在查询无关重用场景下退化时,准确率会骤降11-15个百分点;均匀低秩编码虽保留所有token,但为每个token分配相同秩,造成资源浪费。
研究团队发现这两种方法的问题可通过一个共同方案解决:应该分配秩而非淘汰token。为此他们提出了VarRate,这是一种无需训练的KV编解码器,能够根据每个token的查询显著性为其分配可变低秩预算,确保每个token都保持非零秩。类似的自适应秩编解码器通常需要通过训练才能达到这种分配效果,而VarRate完全无需训练。
由于不丢弃任何token,VarRate在查询感知选择方法失效的场景下仅损失3.5-5.5个百分点的准确率。在LongBench(16个任务)的20%预算测试中,VarRate在Llama-3.1-8B和Qwen2.5-7B模型上均保持与未压缩模型0.8个百分点以内的差距。对两个模型的平均表现显示,它是当前内存匹配压缩中最强的方法。
与专门为查询无关重用设计的KVzip方法相比,VarRate在四种设置中的三种达到准确率相当,总体差距在一个百分点以内,而其预填充开销仅为KVzip的约八分之一。该方法为长上下文LLM推理提供了一种高效、实用的内存优化方案。