论文
SpaceDG:视觉退化下的空间智能基准测试
SpaceDG: Benchmarking Spatial Intelligence under Visual Degradation
摘要
多模态 大语言模型 (MLLM) 在空间智能方面取得了快速进展,但现有的空间推理基准在很大程度上假设原始视觉输入,而忽略了现实世界部署中常见的退化,例如运动模糊、低光、恶劣天气、镜头畸变和压缩伪影。这就提出了一个基本问题:当视觉观察不完善时,当前 MLLM 的空间智能有多稳健?为了回答这个问题,我们引入了 SpaceDG,这是第一个用于退化感知空间理解的大规模数据集。它采用物理物理过程约束的退化合成引擎构建,将退化形成过程嵌入到 3D 高斯泼溅 (3DGS) 渲染中,从而能够真实模拟九种退化类型。生成的数据集包含来自近 1,000 个室内场景的大约 100 万个 QA 对。我们进一步介绍了 SpaceDG-Bench,这是一个经过人工验证的基准,包含 1,102 个问题,涵盖 11 个推理类别和 9 个视觉退化类型,产生超过 10K VQA 实例。对 25 个开源和闭源 MLLM 的评估表明,视觉退化持续严重损害空间推理,暴露出关键的鲁棒性差距。最后,我们表明,SpaceDG 上的微调显着提高了退化鲁棒性,甚至可以超越人类在退化条件下的表现,而在干净图像上没有任何性能下降,这凸显了退化感知训练对鲁棒空间智能的前景。