CacheWeaver:让RAG推理更高效的新方法,可降低首词延迟20-33%

arXiv·31 天前

检索增强生成(RAG)技术虽然能提升事实准确性,但也会增加提示长度和推理成本。现有服务引擎如vLLM中的前缀缓存技术,仅能在请求共享相同令牌前缀时降低成本。然而在真实场景中,相邻查询可能检索到重叠但顺序不同的证据,导致缓存复用率低。

近日研究人员提出CacheWeaver,一种轻量级的提示层方法,通过缓存感知的证据排序优化RAG推理效率。该方法维护最近服务证据序列的前缀树,采用贪心算法将最具复用性的前缀置于首位,同时保持服务引擎和检索证据集不变。

实验显示,在三种vLLM配置下,相比按检索顺序的前缀缓存,该方法将中位数首词生成时间降低了约20-33%,且在问答测试中未损害答案质量。贪心策略达到了理论最优排序97.5%的增益效果,表明通过检索与推理间的简单调度层即可恢复大部分可复用前缀局部性。

这项研究为提升RAG系统实际部署效率提供了实用解决方案,特别适合需要高频处理重叠证据查询的应用场景。

RAG推理优化缓存技术大语言模型arXiv

原文来源:https://arxiv.org/abs/2606.19667

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回