RIMS框架:小模型检索增强生成的新优化方法
在资源受限环境下,小规模语言模型因其轻量特性备受关注,但其有限容量使其对检索证据中的噪声高度敏感。现有基于偏好的优化方法存在明显局限:RoseRAG等方法仅选择最难的单个偏好对,丢弃了其余信号;其他方法将多对偏好视为独立二元比较,导致数据利用率低下。
来自学术界的RIMS框架提出创新解决方案,包含三个核心阶段:首先,无需依赖专有模型,仅使用目标小模型自身通过拒绝采样生成合成思维链偏好数据;其次,引入可微分软聚合机制,用平滑算子替代硬选择,在保留所有偏好对梯度信号的同时,维持边缘感知选择的判别结构;最后,将平滑目标应用于多种对齐算法进行偏好优化。
理论分析表明,平滑近似具有可控误差边界,且平滑聚合相比硬选择能提供更紧密的梯度对齐。在四个多跳问答基准测试中,该方法在多种小模型骨干网络上均优于现有最优基线,在噪声检索条件下实现了准确匹配率和F1分数的稳定提升。该研究为资源受限场景下的检索增强生成提供了新的优化思路,代码已在GitHub开源。