论文
当文本误导时:基于音频的对话的不一致感知推理
When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue
摘要
理解口语对话需要对词汇内容和副语言声音信号(例如情感和对话意图)进行联合推理。然而,现有的评估通常允许基于转录本或单模态解决方案的捷径,从而模糊了模型是否真正基于语音预测。我们将这种失败模式形式化为跨模式分歧,其中记录表明看似合理但不正确的表面解释,而韵律或说话风格等声学线索支持不同的答案。我们开发了一个可扩展的框架,可以识别文本偏向的表面解释,并将分歧区域转换为冲突的 QA 示例。我们还包括基于转录和基于语音的解释一致的一致案例,从而使评估能够超越对抗性音频依赖。由此产生了 ContraTalk,这是一个受控基准,包含跨越五个话语维度的 501 个问题:交互行为、情绪状态、对话行为、社会立场和对话意图。我们进一步开发了一个代理风格的推理框架,将语音转换为音频孪生,这是一种局部声学线索的文本可读表示,可将声学证据暴露给推理模型。实验表明,强纯文本 LLM 在一致情况下的准确率超过 90%,但在冲突情况下下降至 33-48%。 Direct AudioLLM 仅提供部分基础,在大约 30-40% 的冲突情况下仍然选择转录偏向陷阱。我们的音频孪生框架提高了冲突情况的准确性,同时减少了陷阱选择,但其一致的情况行为仍然依赖于主干网。这些结果将基于转录的捷径确定为口语对话理解中的重要失败模式,并表明显式声学证据聚合为诊断和改进基于语音的推理提供了更可控的界面。