新框架LBR:通过局部分支路由实现高效可训练的语言模型测试时扩展
测试时扩展能提升语言模型的推理能力,但现有方法常面临两难:长思维链采样仍是单线程的,而句子或解决方案级别的搜索则计算成本高且难以端到端训练。arXiv最新研究提出局部分支路由(LBR)框架,采用令牌级别的测试时扩展方案。该框架构建小型局部前瞻树,将所有采样分支通过语言模型前传,并利用轻量级路由器选择深度为1的子树进行提交。
LBR的核心创新在于通过候选局部未来状态的隐藏状态进行路由决策,使每个令牌决策能利用超出根节点下一个令牌分布的额外证据,同时避免完整的解决方案级别搜索。这种“剪枝-转移-生长”解码过程保留了离散分支身份,并定义了可处理的树轨迹似然:新生长节点在首次采样时计数,路由器决策被分配显式概率。
这使得端到端强化学习成为可能,可在可验证奖励下,基于与离散令牌RLVR相同的似然比原则联合优化基础模型和路由器。在合成分层规划任务中,LBR证明候选后隐藏状态能提供有用的路由证据。在数学推理基准测试中,LBR在Pass@1和Pass@32指标上均优于离散思维链、原始离散令牌RLVR及RL兼容的软令牌分支基线。研究表明,轻量级局部分支为语言模型测试时扩展提供了一种高效、可训练且离散的新范式。