C³PO基准揭示多模态模型推理缺陷:注意力过度集中于文本

arXiv·27 天前

多模态大语言模型(MLLMs)虽能处理多种感官输入,但其推理能力仍存在明显缺陷。最新研究提出C³PO基准,包含3,404个涵盖视频、音频、图像和文本的样本,专门评估两种关键能力:信息组合(融合分散证据)和反事实冲突(解决故意矛盾)。

该基准采用四层设计,通过25个逻辑模板自动构建,揭示了当前模型的局限性。人类在该基准上达到88.64%的准确率,而表现最佳的Gemini-3.1-Pro模型仅达73.17%,开源模型在冲突场景下更是表现崩溃。

研究发现,86-95%的失败源于模态主导现象:模型倾向于承诺单一模态而忽略矛盾证据,87-95%的注意力集中在文本上。注意力熵分析表明,中间层注意力熵能预测正确性——持续探索成功,过早崩溃失败。

值得注意的是,复杂度相当的模板间存在56个百分点的准确率差距,表明性能取决于模态在冲突解决中的结构角色,而非简单组合。这些发现警示,多模态感知并不保证稳健推理,模型架构需要支持持续的跨模态注意力机制,避免过早决策崩溃。

多模态大模型基准测试跨模态推理注意力机制模态偏见

原文来源:https://arxiv.org/abs/2608.05381

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
无需训练!IDEEA实现输入依赖的激活匹配引导

← 返回