多轮对话压力测试:视觉语言模型在反复追问下的稳定性评估
在现实应用场景中,视觉语言模型不仅需要具备强大的视觉推理能力,还需在持续的对话压力下保持稳定。arXiv最新研究提出‘持续提示’多轮评估框架,专门测试模型在用户反复挑战、质疑或否定其答案时的认知稳定性。该框架采用三种策略进行最多10轮追问:对抗性否定(反复拒绝模型答案)、纯粹苏格拉底式提问(反复要求重新评估确定性)、以及上下文感知的苏格拉底式总结(先复述模型先前推理过程再要求重新考虑)。研究团队在STAR基准测试子集上对GPT-4o、Gemini 2.5 Pro和Qwen3-VL-30B进行了720次多轮测试。虽然从第0轮到第10轮的整体准确率变化不大,但轨迹分析揭示了显著的不稳定性:正确回答可能被推翻,错误回答反而被修正,许多测试出现反复的答案翻转现象。研究表明,重复提示的收益有限,更多时候会破坏稳定性而非辅助推理。这种效应高度依赖具体模型:Qwen3-VL-30B最终准确率最高,但在直接否定下会变得‘自信地错误’;Gemini 2.5 Pro相对稳定但计算成本较高;GPT-4o则表现出最强的脆弱性和振荡性。这些发现表明,多轮评估不仅能测试额外推理能力,还能揭示模型在重复挑战下如何权衡视觉基础、校准能力和对话顺从性的压力响应特征。