论文

SpatialBench:您的空间基础模型是全能型选手吗?

SpatialBench: Is Your Spatial Foundation Model an All-Round Player?

模型评测基准与评测资源

摘要

虽然空间基础模型在标准数据集上表现出了令人印象深刻的性能,但仍然存在一个关键问题:它们是否真正是全能的参与者,能够在不同的下游任务、任意视点、变化的场景域、不同的输入密度和特定的硬件限制中稳健地泛化?回答这个首要问题需要进行整体评估,但当前的模型主要是在专门设计或训练的特定领域进行评估。此类评估本质上受到狭窄范式覆盖、有限场景域和任意帧采样的限制,因此从根本上很难评估其真正的泛化能力。为了解决这一差距,我们提出了 SpatialBench,这是一个跨范式、跨领域的基准,用于具有确定性采样的空间基础模型。 SpatialBench 具有前所未有的规模和严格的确定性设计,包括 19 个数据集和跨 5 个不同空间域的 546 个场景。它在 4 种不同的输入密度设置下,在 5 个任务套件上全面评估了 6 个范式的 41 个模型。我们的广泛评估表明,当前的模型还不是全能的,并揭示了未来发展的重要见解。具体来说,我们证明全上下文注意力最大限度地提高了准确性,而有限内存策略则解锁了长序列可扩展性。此外,我们对具有挑战性的具体任务和以自我为中心的任务的实证评估表明,严格的域对齐和高数据质量对于性能比简单的数据集缩放更为重要。此外,为了解决我们分析中发现的最大数据差距,我们超越了评估,引入了大规模数据集 DA-Next-5M 和强大的基线模型 DA-Next,突破了空间表示学习的界限。