论文
AVERT:口语对话状态跟踪的音频验证裁决
AVERT: Audio-Verified Adjudication for Spoken Dialogue State Tracking
摘要
语音对话状态跟踪从语音中恢复槽值对,其中 ASR 错误集中在实体值中并在各个回合中持续存在,这使其既是生成问题又是编辑问题。强大的每回合文本编辑器可以纠正大部分问题,但仅对转录进行操作会留下三个可恢复的错误:跨回合预测的值不一致、遗漏的插槽以及音频不支持的值。我们提出了 AVERT,它通过将交叉转弯协议与训练有素的音频调节验证器相结合来对每个候选值进行评分,并使用三个运算符(投票、添加和交换)解决三种错误类型,每个运算符都限制在其错误常见的位置。在 SpokenWOZ 上,基本语音 LLM 达到 33.04 JGA、文本编辑器 38.34 和 AVERT 40.13,无需重新训练。尽管 AVERT 使用两个而不是一个 1B 解码器,但这处于消耗完整语音历史记录 (39.32) 的 1B 端到端系统的范围内。音频验证器提供了统计上显着的增益,并且将每个操作员限制为选定的插槽子集很重要:删除它可以让不受限制的投票覆盖正确的分类值并低于编辑器。