测试时缩放技术对小规模视觉语言模型在多语言视觉选择题上的效果分析
测试时缩放技术在大语言模型中已被证明能有效提升推理能力,但其在小规模开源视觉语言模型上的适用性仍不明确。最新研究通过在EXAMS-V多语言视觉选择题基准上对比Qwen2.5-VL-7B-Instruct和Qwen3.5-4B模型,评估了自一致性、描述后推理配合PRM引导波束搜索等多种方法。研究发现,影响性能的关键因素并非搜索或验证机制本身,而是测试时缩放运行的条件。最重要的因素是推理链的可解析性:早期提示格式导致许多推理链虽然正确推理却未输出最终答案选项,而标准答案提示和引导修复步骤能显著改善这一问题。增加解码预算也能带来额外提升:将每条推理链的token限制从1k提高到2k可带来3.7个百分点的性能提升,而增加采样链数量(8到16条)仅贡献0.15个百分点。一旦推理链有足够空间完成推理,复杂方法的贡献有限:PRM引导波束搜索比普通自一致性方法性能低0.39个百分点,但计算成本高出八倍以上;无论是无训练的生成式评判器还是训练过的多模态PRM,在两种策略下都未能超越简单多数投票。最大的性能提升反而来自策略模型本身的改进(+11.4个百分点)。最佳配置在ImageCLEF 2026测试集上达到84.1%的准确率,目前在视觉选择题排行榜上位列第一。