AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
内存效率
3 篇相关内容
相关话题
推理优化
大语言模型
KV缓存压缩
长上下文处理
结构化思维
模型微调
大模型服务
vLLM
VarRate:无需训练即可实现KV缓存变速率压缩,提升长上下文LLM推理效率
研究人员提出VarRate,一种无需训练的KV缓存压缩方法,通过为每个token分配可变低秩预算,在保持所有token信息的同时显著减少内存占用。
a
arXiv
·
1 天前
大语言模型
KV缓存压缩
长上下文处理
推理优化
a
结构化思维框架:提升大模型推理效率与内存优化新突破
研究者提出结构化思维框架,将推理过程分为探索性草稿与精炼结论交替模块,通过微调使模型掌握结构化推理能力,在数学推理任务中性能提升达8.08%,同时实现85%的上下文内存节省。
a
arXiv
·
7 天前
大语言模型
推理优化
内存效率
结构化思维
a
Kara:滑动窗口KV缓存压缩技术,大幅提升推理大模型服务效率
研究者提出Kara滑动窗口KV缓存压缩方法,通过动态选择重要KV对并扩展为语义块,显著降低大模型推理时的内存占用,提升吞吐量。
a
arXiv
·
18 天前
KV缓存压缩
推理优化
大模型服务
vLLM
a