论文
引导在哪里听:基于指令的激活引导重定向大型音频语言模型中的时间注意力
Steering Where to Listen: Instruction-Based Activation Steering Redirects Temporal Attention in Large Audio-Language Models
摘要
大型音频语言模型 (LALM) 擅长音频理解,但很少透露它们在音频信号中的位置。我们引入了基于指令的向量引导,它通过对比不同指令提示的激活来构造引导向量,同时保持音频固定。通过对 LALM 注意力的系统性探索,我们发现,与标准提示或基于音频的引导不同,这种干预显着地重新分配了分配给音频标记的时间注意力,将其集中在声学相关区域。然后,我们证明这种注意力转移在行为上是有意义的:在受控的三事件设置中,读出最大转向引起的注意力变化的时间位置可以在没有任何训练的情况下恢复所查询的声音事件的位置,在 Qwen2-Audio 和 Audio Flamingo 3 上与 真值 间隔实现 60.87% 和 68.72% 的重叠,远高于直接提示(31.84%、46.75%)和随机提示基线(27.74%)。我们的结果表征了 LALM 中基于指令的转向的机械特性,并为这些模型编码的潜在时间结构提供了 无需训练 探针。