AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
内存优化
1 篇相关内容
相关话题
大语言模型
KV缓存
长上下文推理
模型压缩
SeKV:自适应分辨率KV缓存,为长上下文LLM推理提供分层语义记忆
研究人员提出SeKV,一种分辨率自适应的语义KV缓存系统,通过分层存储和按需重建机制,在减少53.3%GPU内存的同时保持模型性能,解决长上下文推理中的内存瓶颈问题。
a
arXiv
·
20 天前
大语言模型
KV缓存
内存优化
长上下文推理
a