论文

选择性聆听:大型音频语言模型中音频影响的机制引导控制

Selective Listening: Mechanism-Guided Control of Audio Influence in Large Audio-Language Models

模型推理模型评测解码与生成控制模型行为与机制分析鲁棒性、公平性与可信度评测

摘要

大型音频语言模型(LALM)利用多模态证据,但在不需要聆听时,与任务无关的音频可能会改变文本推理决策。聚合精度可以隐藏这种配对漂移,因为音频引起的修复和损坏可能会取消。配对漂移分析和有针对性的干预措施将特定于架构的、干预敏感的后期音频路径识别为可操作的控制点。我们引入了 ICAP-Gate,它将机制引导、任务条件控制应用于每个模型的路径。在四个 LALM、两个推理基准以及环境声音和自然语音干扰中,ICAP-Gate 在影响率和答案翻转方面的点估计值低于所有 16 个全分割模型条件评估中的非门控推理。固定抑制会降低所有四种模型的自动语音识别 (ASR),而 ICAP-Gate 通过保留显式音频需求指令的路径来匹配非门控 ASR 性能。在所有四种评估设置中,ICAP-Gate 的配对漂移点估计值均低于缓解提示,并提供有竞争力的 每个查询使用一代时相对于八个样本自一致性的稳定性;在受控 ARC 测量中,自我一致性会导致 $7.0$--$9.2\times$ 非门控延迟。这些结果将选择性模态影响控制确立为稳健多模态推理的设计原则。