AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
大模型服务
1 篇相关内容
相关话题
KV缓存压缩
推理优化
vLLM
内存效率
Kara:滑动窗口KV缓存压缩技术,大幅提升推理大模型服务效率
研究者提出Kara滑动窗口KV缓存压缩方法,通过动态选择重要KV对并扩展为语义块,显著降低大模型推理时的内存占用,提升吞吐量。
a
arXiv
·
18 天前
KV缓存压缩
推理优化
大模型服务
vLLM
a