C³PO基准揭示多模态模型推理缺陷:注意力过度集中于文本
多模态大语言模型(MLLMs)虽能处理多种感官输入,但其推理能力仍存在明显缺陷。最新研究提出C³PO基准,包含3,404个涵盖视频、音频、图像和文本的样本,专门评估两种关键能力:信息组合(融合分散证据)和反事实冲突(解决故意矛盾)。
该基准采用四层设计,通过25个逻辑模板自动构建,揭示了当前模型的局限性。人类在该基准上达到88.64%的准确率,而表现最佳的Gemini-3.1-Pro模型仅达73.17%,开源模型在冲突场景下更是表现崩溃。
研究发现,86-95%的失败源于模态主导现象:模型倾向于承诺单一模态而忽略矛盾证据,87-95%的注意力集中在文本上。注意力熵分析表明,中间层注意力熵能预测正确性——持续探索成功,过早崩溃失败。
值得注意的是,复杂度相当的模板间存在56个百分点的准确率差距,表明性能取决于模态在冲突解决中的结构角色,而非简单组合。这些发现警示,多模态感知并不保证稳健推理,模型架构需要支持持续的跨模态注意力机制,避免过早决策崩溃。