论文
探索以自我为中心的视频理解中的音频幻觉
Exploring Audio Hallucination in Egocentric Video Understanding
摘要
以自我为中心的视频提供了一种独特的设置,其中声音作为理解用户活动和周围环境的关键线索,特别是当视觉信息由于连续摄像机移动而不稳定或被遮挡时。最先进的大型视听语言模型(AV-LLM)可以生成多模态描述。然而,我们在这项工作中表明,他们容易产生幻听,经常从可见但听不到的视觉线索中推断出声音。我们提出了一个系统的、自动的评估框架,用于通过有针对性的问答(Q/A)协议来分析以自我为中心的视频中的音频幻觉。我们整理了包含 300 个以自我为中心的视频的数据集,并设计了 1,000 个以声音为中心的问题来探究模型输出。为了表征幻觉,我们提出了一种基础分类法,可以区分用户活动中的前景动作声音和背景环境声音。我们的评估表明,先进的 AV-LLM(例如 Qwen2.5 Omni)表现出较高的幻觉率,与前景和背景声音相关的 Q/As 准确率分别仅为 27.3% 和 39.5%。通过这项工作,我们强调需要测量多模式反应的可靠性,并强调对幻觉的稳健评估对于开发可靠的 AV-LLM 至关重要。