无需训练!多模态文档问答证据溯源新方法,精度匹敌GPT-5.4

arXiv·18 天前

随着基于证据的问答系统在AI助手中的广泛应用,准确追溯生成答案的来源证据对建立用户信任和保障模型安全至关重要。虽然单模态溯源技术已有深入研究,但多模态场景下的证据溯源仍相对空白。为此,研究团队提出MultAttnAttrib——一种无需训练的多模态溯源生成方法。该方法巧妙利用模型的前向填充过程、精选注意力头及校准阈值,直接在多模态文档中定位答案的证据来源。

为建立评估基准,团队同步发布了MultAttrEval数据集,这是首个专门针对长文档多模态溯源任务设计的评估数据集。该数据集包含精细标注的真实证据溯源信息,覆盖多模态文档中各类答案组件的来源标注。实验结果显示,MultAttnAttrib在多种溯源生成方法中表现突出,不仅显著提升了单模态和多模态溯源的准确率,更在相同基础模型上实现了比提示方法快七倍的推理速度。值得注意的是,该方法在精度上已能与GPT-5.4等前沿模型相媲美,为多模态问答系统的可解释性提供了高效实用的解决方案。

多模态AI问答系统模型可解释性注意力机制基准数据集

原文来源:https://arxiv.org/abs/2607.01420

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回