多轮对话压力测试:视觉语言模型在反复追问下的稳定性评估

arXiv·4 天前

在现实应用场景中,视觉语言模型不仅需要具备强大的视觉推理能力,还需在持续的对话压力下保持稳定。arXiv最新研究提出‘持续提示’多轮评估框架,专门测试模型在用户反复挑战、质疑或否定其答案时的认知稳定性。该框架采用三种策略进行最多10轮追问:对抗性否定(反复拒绝模型答案)、纯粹苏格拉底式提问(反复要求重新评估确定性)、以及上下文感知的苏格拉底式总结(先复述模型先前推理过程再要求重新考虑)。研究团队在STAR基准测试子集上对GPT-4o、Gemini 2.5 Pro和Qwen3-VL-30B进行了720次多轮测试。虽然从第0轮到第10轮的整体准确率变化不大,但轨迹分析揭示了显著的不稳定性:正确回答可能被推翻,错误回答反而被修正,许多测试出现反复的答案翻转现象。研究表明,重复提示的收益有限,更多时候会破坏稳定性而非辅助推理。这种效应高度依赖具体模型:Qwen3-VL-30B最终准确率最高,但在直接否定下会变得‘自信地错误’;Gemini 2.5 Pro相对稳定但计算成本较高;GPT-4o则表现出最强的脆弱性和振荡性。这些发现表明,多轮评估不仅能测试额外推理能力,还能揭示模型在重复挑战下如何权衡视觉基础、校准能力和对话顺从性的压力响应特征。

视觉语言模型模型评估多轮对话稳定性测试大模型

原文来源:https://arxiv.org/abs/2607.14099

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回