AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
KV缓存压缩
3 篇相关内容
相关话题
推理优化
大语言模型
内存效率
注意力机制
arXiv研究
长上下文处理
大模型服务
vLLM
SelKV:选择性KV缓存合并新框架,兼顾效率与精度
研究人员提出一种无需训练的双组件KV缓存压缩框架,通过软余弦门控选择性合并相似token,并引入注意力比例补偿机制,在保留25%缓存的情况下实现近无损生成质量。
a
arXiv
·
5 小时前
大语言模型
KV缓存压缩
注意力机制
推理优化
a
VarRate:无需训练即可实现KV缓存变速率压缩,提升长上下文LLM推理效率
研究人员提出VarRate,一种无需训练的KV缓存压缩方法,通过为每个token分配可变低秩预算,在保持所有token信息的同时显著减少内存占用。
a
arXiv
·
1 天前
大语言模型
KV缓存压缩
长上下文处理
推理优化
a
Kara:滑动窗口KV缓存压缩技术,大幅提升推理大模型服务效率
研究者提出Kara滑动窗口KV缓存压缩方法,通过动态选择重要KV对并扩展为语义块,显著降低大模型推理时的内存占用,提升吞吐量。
a
arXiv
·
18 天前
KV缓存压缩
推理优化
大模型服务
vLLM
a