论文
潜在流内部:音频分离基础模型中注意力动态的因果解读
Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models
摘要
流匹配 Transformer 实现了强大的音频分离,但它们的注意力动态是不透明的。我们将既定的因果干预原则改编为 SAM Audio 的确定性推理时间探测协议。正交探测揭示了双路径文本调节机制:加法注入控制语义身份,而交叉注意力则细化声学结构。我们观察到异步分层收敛:稳定层尽早构建时间支架,而快速层在采样期间继续解决伪影。该模型还减弱时间分割线索以保持连续流稳定性。利用这些见解,我们提出了层选择性注意力缓存(LSAC),这是一种 无需训练 加速方法,可将注意力缓存在稳定层中。在声学复杂性方面,LSAC 将自注意力计算量减少了约 25%,质量损失可以忽略不计,并且质量保留率比朴素步骤减少高出 6.7 倍。