视觉任务语义挑战:多模态大模型在图文混合指令下表现显著下滑

arXiv·28 天前

当前多模态大语言模型已能处理包含文本和图像的复杂文档,但主流评测通常将问题以纯文本形式呈现,忽略了实际应用中任务指令可能直接嵌入图像的情况。为此,研究者设计了“视觉化任务语义”实验框架,将原本的文本问题移至图像区域,保持问题本质和答案不变,系统评估模型跨通道理解能力。

在涵盖6个主流多模态大模型和4个基准测试的24组实验中,所有模型在视觉化指令下的表现均出现下滑,平均准确率下降17.8%。值得注意的是,模型虽能正确识别图像中的文字内容,却无法有效将其转化为可执行的指令,这表明问题不仅在于光学字符识别精度,更源于深层的“语义通道鸿沟”——模型对同一指令在不同呈现形式下的处理机制存在本质差异。

为弥合这一差距,研究团队提出“提示区域定位”技术。该方法的核心创新在于:通过语义对齐将问题区域与类型化语义关联,并从掩码视图中恢复清晰的指令表征。在同等训练成本下,该技术将四个基准测试的视觉化任务准确率从58.0%提升至66.3%,同时保持模型在原始文本界面上的性能。更重要的是,该方法在推理阶段无需依赖OCR或区域元数据,展现出良好的实用性和泛化能力。

这项研究揭示了一个关键认知:识别任务文本与将其作为推理指令进行落地,是多模态大模型需要分别掌握的两项独立能力。该发现为提升模型在真实场景中的鲁棒性提供了重要方向。

多模态大模型视觉推理指令理解语义鸿沟arXiv研究

原文来源:https://arxiv.org/abs/2608.04726

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
无需训练!IDEEA实现输入依赖的激活匹配引导

← 返回