论文
SVHalluc:视听中的语音视觉幻觉基准测试 大语言模型
SVHalluc: Benchmarking Speech-Vision Hallucination in Audio-Visual Large Language Models
摘要
尽管视听大语言模型(LLM)取得了成功,但它们可以产生看似合理但缺乏根据的输出,称为幻觉。现有的基准侧重于环境声音(例如狗叫声)来指示事件发生。相比之下,人类语音具有根本不同的丰富语义和时间结构,但当前模型是否能够准确地将语音内容与相应的视觉信号对齐仍有待探索。在这项工作中,我们证明语音内容可以诱发视听幻觉 LLM。为了系统地研究这一点,我们引入了 SVHalluc,这是第一个评估视听中语音视觉幻觉的综合基准 LLM。我们的基准从两个关键且互补的方面诊断语音视觉幻觉:语义和时间。实验结果表明,最先进的开源视听 LLM 很难将语音内容与相应的视觉信号对齐,并且在多个任务上具有近乎随机的准确性。相比之下,Gemini 2.5 Pro 的性能明显优于开源型号。我们的分析表明,尽管它们在单模态感知方面表现出色,但其失败源于跨模态理解能力有限。我们的工作揭示了当前视听 LLM 的一个新的基本限制,并强调了基于语音的视频理解的需求。项目页面:https://chenshuang-zhang.github.io/projects/svhalluc/。