知识型视觉问答基准测试的缺陷识别与修复

arXiv·19 天前

知识型视觉问答旨在评估视觉语言模型能否基于外部结构化知识进行检索、关联和推理。当前研究普遍采用答案准确率作为核心评估指标,隐含假设正确性能够反映知识推理能力。然而最新研究表明,现有基准测试存在三个关键假设缺陷:标注答案必须能从知识库推导得出、问题需具备充分约束条件、视觉场景需真正需要知识消歧。

研究团队对主流数据集进行系统性审计,发现大量实例存在答案缺失或矛盾、问题定义模糊等问题,导致准确率指标严重失真。更关键的是,现有数据集多采用视觉信息单一的场景,模型无需复杂视觉-知识映射即可作答,这掩盖了真实推理能力的不足。实验表明,即使控制模型架构,这些缺陷仍会导致错误的性能排名和推理能力高估。

为解决这一问题,研究提出双重方案:一是建立审计修复协议,恢复答案可推导性和问题清晰度;二是设计可控多实体增强协议,引入视觉歧义以挑战初始检索和关联推理能力。在修正和增强设置下的重新评估显示,模型表现趋势发生显著变化。这项工作呼吁重新思考评估协议,设计更注重可验证推理而非简单匹配的新型基准测试。

视觉问答基准测试评估方法多模态AI知识推理

原文来源:https://arxiv.org/abs/2607.00159

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回