论文
从语义到读出:音频时序定位微调后音频词元的机制分析
From Semantics to Readout: Mechanistic Understanding of Audio Tokens after Fine-Tuning for Temporal Audio Grounding
摘要
大型音频语言模型(LALM)通过本机音频标记向语言解码器传递声学证据,但这些标记的内部作用仍然知之甚少。使用时间音频基础作为诊断设置,我们通过四个补充分析来检查语言模型 微调 如何影响分层语义、解码器可访问性和本地音频词元状态的时间输出对齐:查询条件词元语义、校准词元读出、时间窗口探测和生成过程中的残余增量擦除。除了时间定位方面的重大改进之外,Qwen2.5-Omni 的语义分析表明,查询事件的潜在证据在 微调 之前已经存在,并且与查询事件最一致的音频标记出现在 微调 之前和之后的相似时间位置。在 微调 之后,音频词元中的事件相关信息变得更容易被解码器访问,特别是在早期和中间层,并且交叉检查点控制表明这种改进主要来自解码器自适应。时间探测表明,基本检查点已经包含有关带注释的窗口的可恢复信息,并且 微调 主要改进了与每个检查点自己的预测时间支持的对齐。残余增量擦除进一步表明,删除预测窗口内的音频词元更新比删除相同数量的随机选择的更新更损害时间戳生成。 Qwen2-Audio 中也出现了解码器可读性和预测对齐方面的相同广泛改进。总之,这些结果支持从语义到读出的说明,其中时序定位微调 有助于解码器读取现有事件证据并将其更可靠地连接到时间输出。