论文
听、看、追踪:面向全模态语言模型的时空视听声事件推理
Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models
摘要
理解动态声源需要同时确定什么产生了声音、声源位于何处以及它如何随时间移动。然而现有音频-语言模型常将音频片段表示为全局声学事件,而视觉-语言模型又缺乏定位和跟踪单个声源所需的空间音频线索。为评估这一缺失能力,我们提出ST-OmniQA,一个时空视听问答基准,由全景视频与同步的一阶Ambisonics(FOA)移动声源音频配对构成。它包含4万个视频和40万个问答对,组织为四个能力层级,涵盖声事件识别、到达方向、声源距离、运动轨迹以及时间锚定的视听推理。在该基准之上,我们提出ST-Omni-R1,它将FOA导出的语义和轨迹表示与全景视觉上下文整合,并通过渐进式课程学习和推理树强化学习训练。ST-Omni-R1在四个层级上取得77.83%的平均语义准确率,而评估的最佳基线为37.28%。在三个公开空间音频基准上的结果进一步表明,其学到的空间与运动表示可迁移到ST-OmniQA之外。
