论文
专心聆听:基于 Transformer 的音频模型的熵引导可解释性
Listening with Attention: Entropy-Guided Explainability for Transformer-Based Audio Models
摘要
基于 Transformer 的自动语音识别 (ASR) 模型(例如 Whisper)非常准确,但它们的预测仍然难以解释。现有的可解释人工智能(XAI)方法通常缺乏 忠实性 和精确的时间定位。我们提出用熵引导注意力进行聆听以实现忠实的可解释性(LEAF-X),这是一种用于基于 Transformer 的 ASR 的模型内在 XAI 框架。 LEAF-X 结合了熵引导的注意力加权、多层注意力逐层传播和可选的因果消融来识别低熵、高影响力的头部和层,产生稀疏的词元到帧的归因。与基于扰动的解释器或原始注意力图不同,LEAF-X 利用编码器-解码器和仅语音增强解码器模型的内部结构来生成更好地反映模型计算的解释。结果显示,忠实性 提高了 32%,局部性/稀疏性增强了 35-39%,归因最稳定,支持更透明和可审计的 ASR。