论文

FloorSAV:利用 AV-LLM 的 2D 平面图阐明空间视听背景

FloorSAV: Elucidating Spatial Audio-Visual Context with 2D Floormap for AV-LLMs

上下文与知识模型评测应用与实践上下文工程基准与评测资源视觉感知与空间理解

摘要

虽然动态自我中心环境中的 3D 空间推理对于体现智能至关重要,但视听大语言模型 (AV-LLM) 缺乏直接从原始感官流处理和内化全局几何的明确机制。现有方法要么需要昂贵的微调,要么没有充分利用模型的跨模式推理能力。在本文中,我们提出了 FloorSAV,这是一种新颖的框架,通过渲染动态 2D 楼层地图来明确地奠定空间视听上下文。通过集成 3D 点云、摄像机轨迹、空间音频提示和语义接地对象地标,我们将此楼层图作为与自我中心视频的同步流注入 AV-LLM。 AV-LLM 利用其多模态功能,通过平面地图解释指导,在单一推理中对视觉、听觉和几何线索进行联合推理。我们进一步引入SAVED-Bench(具有动态代理的空间视听自我中心基准),构建现实场景中空间能力的基本任务:动态相对论、区域和路径 推理问答。 FloorSAV 改进了 AV-LLM 对 SAVED-Bench 和 SAVVY-Bench 的各种任务的空间推理。对地面真实楼层地图的研究证明了 FloorSAV 具有准确空间信息的巨大潜力。