无需训练!新框架让多模态大模型更懂知识问答

arXiv·27 天前

在知识型视觉问答任务中,模型需要结合图像内容与外部知识进行推理。虽然当前多模态大语言模型具备强大的感知能力,但在需要同时进行细粒度实体识别和证据检索的任务中仍面临挑战。现有方法通常将实体判别与证据排序耦合在单一阶段,导致计算成本高且泛化能力有限。

来自arXiv的最新研究提出了一种创新的“先识别后排序”框架。该研究指出,实体级和事实级的基础能力是当前多模态检索增强生成方法的关键瓶颈。有趣的是,尽管多模态大模型在开放式实体命名中表现不佳,但在给定候选实体集合时却能更准确地识别正确实体。

基于这一发现,研究人员设计了无需训练的IBA框架,将实体识别与证据检索解耦。该方法首先提示多模态大模型从候选实体名称中选择高置信度的实体,然后使用现成的文本重排序器进行证据选择。在Encyclopedic-VQA和InfoSeek数据集上的实验表明,该方法不仅超越了经过微调的多模态重排序基线模型,还大幅降低了训练和推理复杂度。

进一步分析显示,性能提升不仅源于更好的实体识别能力,还因为固定正确实体后能够选择更具信息量的证据。该研究为多模态知识问答提供了更高效、更通用的解决方案,相关代码已开源以促进可复现性。

多模态大模型视觉问答检索增强生成知识推理实体识别

原文来源:https://arxiv.org/abs/2606.23881

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回