论文
REVE:通过重用编码器状态对大型音频语言模型进行有效的幻觉校正
REVE: Efficient Hallucination Correction for Large Audio-Language Models via Reused Encoder States
摘要
大型音频语言模型可能会提到输入中不存在的声学事件。单独的音频事件检测器可以验证这些提及,但这样做需要第二个音频编码器和单独的前向传递。我们提出了用于验证事件的重用编码器状态(REVE),这是一种使用目标模型已计算的状态的轻量级方法。一个读数总结了跨音频帧的类别分数,而另一个读数则使用四个连续帧间隔的汇总状态。类感知分数融合结合其输出来验证生成的事件提及,而无需再次对音频进行编码。在 AudioSet 上,REVE 在忠实提及召回约束下删除了 92.9% 的标签不受支持的提及。由于添加的参数较少且无需第二次音频编码,REVE 实现了与 CED-Tiny 和 CED-Base 相当的减少。其完整验证延迟约为 CED-Base 路径的 1/18。受控 DESED 混合和不同目标模型架构的结果进一步证实了编码器状态重用的有效性。