SeKV:自适应分辨率KV缓存,为长上下文LLM推理提供分层语义记忆

arXiv·20 天前

随着大语言模型处理长上下文的需求日益增长,KV缓存成为主要的内存瓶颈——其大小随序列长度线性增长,且必须在解码过程中全程保留,使得完整的GPU缓存成本高昂。现有KV缓存压缩方法难以在效率与上下文保真度之间取得平衡:令牌驱逐会丢失信息,而语义分组在预填充阶段就固定了压缩决策,两者都无法在生成过程中按需恢复令牌级细节。

为此,研究团队提出SeKV系统,这是一种分辨率自适应的语义KV缓存架构。该系统将上下文组织成基于熵指导的语义片段,并在GPU-CPU内存层次结构中存储这些片段,避免信息丢弃。每个片段在GPU上保留轻量级摘要向量用于粗略路由,在CPU上存储低秩SVD基用于按需令牌级重建。训练得到的放大机制能够在解码过程中选择性扩展与查询相关的片段,实现精确检索而无需在GPU上物化完整KV缓存。

SeKV支持自适应令牌级重建,同时保持基础LLM完全冻结,仅增加不到0.05%的可训练参数。在四个基准测试中,SeKV相比最强的语义压缩基线平均提升5.9%性能,在128K上下文长度下,相比完整KV缓存减少53.3%的GPU内存占用。该系统代码已在GitHub开源。

大语言模型KV缓存内存优化长上下文推理模型压缩

原文来源:https://arxiv.org/abs/2606.31145

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回