VarRate:无需训练即可实现KV缓存变速率压缩,提升长上下文LLM推理效率

arXiv·1 天前

在长上下文大语言模型推理中,键值(KV)缓存是主要的内存瓶颈。现有无需训练的压缩方法存在明显局限:令牌选择方法(如SnapKV、Ada-KV)会根据观察窗口评分淘汰低分token,但这种淘汰不可逆——当重要性信号在查询无关重用场景下退化时,准确率会骤降11-15个百分点;均匀低秩编码虽保留所有token,但为每个token分配相同秩,造成资源浪费。

研究团队发现这两种方法的问题可通过一个共同方案解决:应该分配秩而非淘汰token。为此他们提出了VarRate,这是一种无需训练的KV编解码器,能够根据每个token的查询显著性为其分配可变低秩预算,确保每个token都保持非零秩。类似的自适应秩编解码器通常需要通过训练才能达到这种分配效果,而VarRate完全无需训练。

由于不丢弃任何token,VarRate在查询感知选择方法失效的场景下仅损失3.5-5.5个百分点的准确率。在LongBench(16个任务)的20%预算测试中,VarRate在Llama-3.1-8B和Qwen2.5-7B模型上均保持与未压缩模型0.8个百分点以内的差距。对两个模型的平均表现显示,它是当前内存匹配压缩中最强的方法。

与专门为查询无关重用设计的KVzip方法相比,VarRate在四种设置中的三种达到准确率相当,总体差距在一个百分点以内,而其预填充开销仅为KVzip的约八分之一。该方法为长上下文LLM推理提供了一种高效、实用的内存优化方案。

大语言模型KV缓存压缩长上下文处理推理优化内存效率

原文来源:https://arxiv.org/abs/2607.15498

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回