论文
C³PO:评估全模态模型的跨模态组合与反事实表现
C$^3$PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models
摘要
当前的多模态大语言模型(MLLMs)能够处理多种感官输入,但其推理仍 heavily biased towards a dominant modality,导致跨模态推理脆弱。我们引入C$^3$PO,这是一个包含3,404个样本的数据集,涵盖视频、音频、图像和文本,评估两个能力:信息组合(融合分散的证据)和反事实冲突(解决故意矛盾)。C$^3$PO的配对IC/CC结构和四层设计使我们能够针对性地诊断跨模态推理失败时和为什么。通过使用25个逻辑基础模板构建C$^3$PO,我们发现人类达到88.64%的准确率,而最佳模型(Gemini-3.1-Pro)仅达到73.17%,开源模型在冲突下崩溃。通过注意力探针,我们发现86-95%的失败源于模态偏见:模型倾向于一个模态而忽视矛盾证据,集中87-95%的注意力于文本。中间层注意力熵预测正确性持续探索成功,提前崩溃失败。56点准确率差距揭示了性能取决于冲突解决中的模态结构角色,而不是组合。这些发现表明多模态感知并不保证稳健推理;架构必须使跨模态注意保持可持续以避免提前崩溃。
