论文

信任还是不信任:语音中的检索增强事实检查

To Trust or Not to Trust: Retrieval-Augmented Fact Checking in Speech

模型评测基准与评测资源

摘要

在线错误信息越来越多地以口头形式出现,例如新闻剪辑、播客、采访、政治演讲和社交媒体视频,这就需要事实核查系统来直接从言论中验证主张。我们推出了 VeriSpeak,这是一个用于研究大型音频语言模型 (LALM) 中基于语音的事实验证的探测基准。 VeriSpeak 包含 3,879 个口头主张,涵盖时间、地理和关系事实,并带有平衡的真假标签。该基准旨在检查事实验证能力是否从文本转移到语音,以及检索增强的 LALM 是否可以使用文本证据来正确支持或反驳口头主张。我们的实验揭示了一致的文本-语音模态差距:可靠地验证书面声明的 LALM 在口头声明时通常会失败。此外,仅检索提供的收益有限,因为模型经常将检索到的证据与口头主张混为一谈。相比之下,检索与显式推理相结合可以改善主张与证据的比较,经过思维调整的 LALM 准确率达到 86.1%。 VeriSpeak 强调,有效的语音错误信息检测不仅需要语音理解,还需要对检索到的证据进行有根据的推理。该数据集可通过 Hugging Face 在此 https URL 公开获取。