论文

模态断层线:结构性腐败揭示脆弱的全模态推理

Modality Fault Lines: Structural Corruptions Reveal Fragile Omni-Modal Reasoning

模型评测鲁棒性、公平性与可信度评测

摘要

全模态 大语言模型 越来越多地在干净的文本-视觉-音频输入上进行评估,其中每个通道都存在、同步且易于解释。这些分数通常被视为强大的跨模态融合的证据,但干净的评估无法判断成功是否取决于稳定的跨模态结构或仅取决于完整输入的足够线索。为了解决这一差距,我们定义了一条模态断层线:当模态仍然存在且可供人类解释时,模型行为在该边界处变得不稳定,但其内部证据结构受到干扰。我们引入了 SCEval(结构损坏评估),这是一种诊断评估协议,可保持问题、答案空间和模态通道固定,同​​时将受控的结构损坏单独或联合应用于文本、视觉和音频。 SCEval 基于来自 Social-IQ、OmniBench 和 VALOR 的 273 美元人工验证三模态示例构建,评估了 15 美元的专有和开源全模态系统。结果表明,结构损坏会降低清洁准确度,文本-视觉损坏形成最稳定的共享断层线,多模态退化是非累加性的,而不是损坏模态数量的简单函数。因此,干净的全模态准确性并不能证明当跨模态证据在结构上变得不可靠时模型仍然可靠。