论文
失语:跨音频和文字记录的三语口语幻觉检测
Lost in Speech: Trilingual Spoken Hallucination Detection Across Audio and Transcripts
摘要
虽然基于文本的幻觉检测已得到充分研究,但对语音事实改变的无参考检测仍未得到充分探索,特别是对于资源匮乏的语言。我们的口语基准包括 12,013 个英语、俄语和哈萨克语新闻样本,具有三种合成更改类型和三个严重级别,将源文章与重写为文本、合成音频和 ASR 转录本配对。我们添加了以俄语 (225) 和哈萨克语 (65) 收集的 290 个经过事实检查的错误信息项,翻译成其他语言并通过相同的 TTS-ASR 管道呈现。我们评估文本、文字记录和音频上的微调多语言编码器和零样本多模态解码器。探测器仅接收目标输入,没有来源物品或外部证据;该任务评估无参考分类而不是基于证据的验证。从源文本到转录本的编码器降级通常会跟踪二进制任务中每种语言的 ASR 错误。在解码器中,只有 Gemma-3n 超过了 Macro-F1 中的二进制多数类基线(仅在转录本上);其他四个都低于各自的基线。音频和成绩单之间的比较因评估覆盖范围和班级平衡的差异而变得混乱。经过综合训练的检测器在现实世界的错误信息源文本上实现了 0.82--0.88 宏 F1;俄罗斯的起源分析揭示了与准确性相关和模型相关的机器风格信号,这是合成幻觉基准中的一个关键混淆因素。