LaViSA:首个视觉语言模型结构歧义评测基准发布
结构歧义指同一句子因语法结构可产生多种合理解释,是语言理解的核心挑战之一。视觉场景常能为消解此类歧义提供关键线索,因此视觉语言模型需要具备从图像中推导可能语义的能力。为此,研究团队提出了语言与视觉结构歧义基准LaViSA,旨在系统评估视觉语言模型借助视觉信息解决结构歧义的表现。该基准涵盖七类歧义现象,每类包含歧义句、消歧后的句子及对应场景图像。团队对多款视觉语言模型进行了全面测试,包括不同参数规模与推理能力的开源模型及商业模型。实验表明,尽管当前先进模型已能一定程度利用视觉线索消解歧义,但在特定歧义类型和视觉语义细微差异上仍存在明显不足,揭示出现有模型在视觉辅助消歧任务上仍有提升空间。