论文
通过模态子空间激活诊断和减轻 Omni-LLM 中的感知决策偏差
Diagnosing and Mitigating Perception-Decision Misalignment in Omni-LLMs via Modality Subspace Activation
摘要
Omni-大语言模型 (Omni-LLM) 在世界行动模型和自主代理等应用中支持复杂的多模态推理。然而,它们的强劲表现往往掩盖了深刻的感知决策错位(PDM),即决策仍然不忠实于多模式感知。为了诊断这一点,我们将因果模态敏感性 (CMS) 形式化,通过双镜头框架进行操作:宏观行为层面的答案保留率 (ARR) 和跟踪微观分布变化的 logits 角度差异 (LAD)。我们还策划了 CausalMSBench,一个隔离语言先验的诊断数据集。基准测试显示,流行的 Omni-LLM 表现出极低的 CMS,即使删除关键模式,也显示出可以忽略不计的分布变化。为了纠正这个问题,我们提出了模态子空间激活(MSA),这是一种 无需训练 推理时间框架,它使用奇异值分解(SVD)来估计模态激活强度。 MSA 动态平衡最后隐藏状态中的模态投影,有效地跨基准恢复 CMS。