论文
超越文本跟随:音频语言模型中可修复的仲裁逆转
Beyond Text Following: Repairable Arbitration Reversals in Audio-Language Models
摘要
音频语言模型 (ALM) 经常遵循与音频冲突的文本,即使音频证据是清晰的。这就提出了一个基本问题:音频支持的答案是否不可用,或者它是否已被表示但被冲突的文本覆盖?我们使用相同音频反事实来检查这个问题,该反事实保持音频固定,仅删除冲突的文本,并测量模型偏好的最终变化。在五个 ALM 和四个冲突任务中,64.1% 的冲突样本显示出符号翻转:相同音频分支更喜欢音频支持的答案,而联合分支更喜欢文本支持的答案。这种模式表明相关音频证据已被编码,但在仲裁中丢失。激活补丁进一步将反转定位到答案位置计算,并且补丁效果密切跟踪输出候选分数差异(Spearman rho = 0.93)。使用此诊断,我们提出门控音频反事实 logits 校正 (GACL),这是一种在联合音频分数和相同音频分数之间进行插值的 无需训练 解码规则。在严格的 5 pp 忠实性-drop 预算下,GACL 将 nAUC 比最佳对比基线提高了 17.8 点,并且无需重新调整到视觉文本仲裁(最多 +40.5 pp)。