论文

生成、分析和优化:通过 MLLM 元推理进行 无需训练 声源定位

Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning

模型推理推理策略与问题分解

摘要

声源定位任务旨在通过利用音频和视觉模态之间的相关性来识别发声物体的位置。大多数现有的 SSL 方法依赖于基于对比学习的特征匹配,但缺乏明确的推理和验证,限制了其在复杂声学场景中的有效性。受人类元认知过程的启发,我们提出了一个 无需训练 SSL 框架,该框架利用多模态 大语言模型 (MLLM) 的内在推理能力。我们的生成-分析-细化 (GAR) 流程由三个阶段组成:生成生成初始边界框和音频分类;通过开放式角色标签和主播投票分析量化视听一致性;细化应用自适应门控以防止不必要的调整。对单源和多源基准的大量实验证明了具有竞争力的性能。源代码可在 https://github.com/VisualAIKHU/GAR-SSL 获取。