LLaMA 3变身高效重排器:知识蒸馏助力RAG性能提升
在检索增强生成(RAG)系统中,交叉编码器虽能提供高精度的重排效果,但其二次方的推理复杂度限制了实时部署。最新研究提出创新解决方案:通过两阶段流程将LLaMA 3 8B模型转化为高效的重排器。
研究团队首先使用Unsloth框架配合LoRA适配器,在定制化的查询-文档相关性数据集上对LLaMA 3进行监督微调。随后采用4位量化技术优化推理效率。该模型可无缝替换传统交叉编码器,应用于结合BM25和稠密向量检索的双检索器RAG管道。
在基于RAGAS框架的领域特定问答基准测试中,微调后的LLaMA 3重排器表现突出:相比交叉编码器基线,答案相关性提升14%,上下文精确度提高16%,答案相似度增加19%,答案正确率更是提升了21%。同时,4位量化技术有效降低了推理开销。
这项研究证明,经过指令调优的大语言模型能够转化为准确高效的重排器,摆脱传统交叉编码器的二次方复杂度限制,为RAG系统的实际部署提供了新的技术路径。该方法在保持高性能的同时显著优化了计算资源使用,具有重要的应用价值。