论文

查看、记住、探索:流式空间推理的基准和基线

See, Remember, Explore: A Benchmark and Baselines for Streaming Spatial Reasoning

模型评测基准与评测资源

摘要

空间理解对于实体代理来说是基础,但大多数空间 VLM 和基准测试仍然是对预先记录的输入进行离线评估事后 QA,并忽略了两个关键的部署关键要求:长视野流式推理和当前视图不足时的主动感知。为了解决这一差距,我们引入了 S3-Bench,这是一个通过主动探索进行流式空间问答的基准套件,其中查询暂时基于特定时间戳,并且必须仅使用截至该时刻可用的观察结果来回答。 S3-Bench采用双域设计,将可扩展的模拟器与可控轨迹和探索动作相结合,并结合真实世界的流媒体视频来捕获实际的传感工件以进行严格的泛化评估。总体而言,它跨越 10K+ 场景和 26K+ 轨迹,并具有专门的训练 (S3-Train) 和评估 (S3-Eval) 分割。我们进一步提出了 AMF-VLM,它通过以下方式支持有界计算下的流式空间推理:(i)内存折叠,将长视野观察压缩为紧凑的结构化内存;以及(ii)主动探索,输出显式动作(例如移动/旋转/扫描)以在回答之前获取缺失的证据。大量实验表明,与使用相同训练数据的模型相比,我们的方法在 S3-Eval 的模拟分割和真实分割上分别提高了 8.8% 和 13.3%,同时保持了对标准空间基准的竞争性可转移性。