AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
长上下文处理
1 篇相关内容
相关话题
大语言模型
KV缓存压缩
推理优化
内存效率
VarRate:无需训练即可实现KV缓存变速率压缩,提升长上下文LLM推理效率
研究人员提出VarRate,一种无需训练的KV缓存压缩方法,通过为每个token分配可变低秩预算,在保持所有token信息的同时显著减少内存占用。
a
arXiv
·
1 天前
大语言模型
KV缓存压缩
长上下文处理
推理优化
a