KV-PRM:通过KV缓存迁移实现高效过程奖励建模,加速多智能体测试时扩展

arXiv·8 天前

过程奖励模型(PRM)已被证明在指导测试时扩展方法方面非常有效,能显著提升基于大语言模型的多智能体系统能力。然而,现有的PRM都是基于文本的:它们需要从头重新编码整个轨迹文本。在多智能体的长序列任务中,评分成本随序列长度L呈二次方增长,形成了严重的计算瓶颈,极大限制了PRM在长上下文场景中的应用。

为解决这一问题,研究团队提出了KV-PRM,这是一种高效的过程奖励模型,通过直接读取LLM生成阶段自然产生的KV缓存,避免了繁重的文本重新编码。该方法通过处理单个“验证令牌”来利用预存的KV缓存,将评分成本从O(L²)降低到O(L)。

研究团队从理论上证明了KV缓存比文本包含更严格的信息容量,对下游奖励建模更为高效。在MATH、GSM8K和AIME等基准测试中,KV-PRM在各种测试时扩展方法(如波束搜索、蒙特卡洛树搜索和加权投票)下,性能与文本PRM相当或更优,同时实现了高达5000倍的评分计算量减少、37倍的延迟降低和34倍的每序列内存占用减少。

这项技术突破为多智能体系统在复杂长序列任务中的实际部署扫清了关键的计算障碍,有望推动大语言模型在需要长期规划和协作的AI应用中的进一步发展。

过程奖励模型KV缓存多智能体系统计算优化大语言模型

原文来源:https://arxiv.org/abs/2607.09153

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回