AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
vLLM
2 篇相关内容
相关话题
KV缓存压缩
推理优化
大模型服务
内存效率
Hugging Face
模型部署
推理服务
云计算
Kara:滑动窗口KV缓存压缩技术,大幅提升推理大模型服务效率
研究者提出Kara滑动窗口KV缓存压缩方法,通过动态选择重要KV对并扩展为语义块,显著降低大模型推理时的内存占用,提升吞吐量。
a
arXiv
·
18 天前
KV缓存压缩
推理优化
大模型服务
vLLM
a
一键部署vLLM推理服务器,Hugging Face Jobs新功能上线
Hugging Face推出新功能,用户仅需一条命令即可在Jobs服务中启动vLLM推理服务器,极大简化了大型语言模型的部署流程。
H
Hugging Face
·
25 天前
快讯
vLLM
Hugging Face
模型部署
推理服务
H