论文

全模态不和谐基准:系统地打破模态共识以探测稳健性和校准弃权

Omni-Modal Dissonance Benchmark: Systematically Breaking Modality Consensus to Probe Robustness and Calibrated Abstention

模型评测基准与评测资源

摘要

现有的全模态基准试图衡量特定模态的贡献,但它们的测量结果是混乱的:自然共存的模态携带相关但不平等的信息,使得结果是否反映真正的模态依赖或信息不对称尚不清楚。我们引入了 OMD-Bench,其中所有模态最初都是一致的 - 每个模态都呈现相同的锚点、可通过视频、音频和文本独立感知的对象或事件 - 然后我们系统地破坏以隔离每种模态的贡献。我们还评估了校准弃权:当证据相互矛盾时,模型是否适当地避免回答。该基准测试包含 4,080 个实例,涵盖 27 个锚点,涵盖 8 个损坏条件。在零样本和思维链提示下评估十个全模态模型,我们发现当两种模态被损坏时模型过度放弃,而当三种模态全部损坏时模型严重不足,同时即使在完全损坏的情况下也保持高置信度(〜60-100%)。思想链提示可以提高弃权与人类判断的一致性,但会放大而不是减轻过度自信。 OMD-Bench 提供了诊断基准,用于诊断模态依赖性、跨模态不一致性的鲁棒性以及全模态系统中的不确定性校准。