论文

口语对话中的上下文感知多模态声明验证

Context-Aware Multimodal Claim Verification in Spoken Dialogues

模型评测基准与评测资源

摘要

口头事实主张通常发生在多轮对话中,其中周围的对话可以提供仅从主张中无法获得的上下文。然而,大多数事实核查研究评估的是孤立的文本,而对对话音频的研究不足。我们推出了 MAD2,这是一种用于口头声明验证的合成多轮音频对话基准,包含 1,000 个双说话人对话、1,230 个值得检查的句子级候选注释以及大约 10 小时的音频。我们还提出了上下文感知音频编码器和对话感知文本模型的校准多模态融合。添加对话上下文可以改善跨设置的验证,尽管收益因场景而异。仅过去上下文通常接近本地离线性能,这表明当未来上下文不可用时它是有用的。与具有完整对话上下文的文本相比,Fusion 实现了最高的平均优势,但在不同设置下的表现并没有始终如一或显着优于文本。在完整对话背景下,探索性子组结果显示,文本和融合的对话场景之间的性能差异更大,但音频的传播风格之间的性能差异更大。