LaViSA:首个视觉语言模型结构歧义评测基准发布

arXiv·31 天前

结构歧义指同一句子因语法结构可产生多种合理解释,是语言理解的核心挑战之一。视觉场景常能为消解此类歧义提供关键线索,因此视觉语言模型需要具备从图像中推导可能语义的能力。为此,研究团队提出了语言与视觉结构歧义基准LaViSA,旨在系统评估视觉语言模型借助视觉信息解决结构歧义的表现。该基准涵盖七类歧义现象,每类包含歧义句、消歧后的句子及对应场景图像。团队对多款视觉语言模型进行了全面测试,包括不同参数规模与推理能力的开源模型及商业模型。实验表明,尽管当前先进模型已能一定程度利用视觉线索消解歧义,但在特定歧义类型和视觉语义细微差异上仍存在明显不足,揭示出现有模型在视觉辅助消歧任务上仍有提升空间。

视觉语言模型结构歧义评测基准多模态理解自然语言处理

原文来源:https://arxiv.org/abs/2606.19552

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回