论文
SpatialClaw:重新思考代理空间推理的动作界面
SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning
摘要
空间推理、确定对象的位置、它们如何关联以及它们如何在 3D 中移动的能力,仍然是视觉语言模型 (VLM) 的基本挑战。工具增强代理试图通过用专业感知模块增强 VLM 来解决这个问题,但它们的有效性受到调用这些工具的操作界面的限制。在这项工作中,我们研究了该界面的设计如何塑造代理的开放式空间推理能力。现有的空间代理要么采用单遍代码执行,在观察任何中间结果之前致力于完整的分析策略,要么依赖结构化的工具调用接口,该接口通常为自由组合操作或针对每个任务定制分析提供较低的灵活性。这两种设计都为开放式、复杂的 3D/4D 空间推理提供了有限的灵活性。因此,我们提出了 SpatialClaw,一个采用代码作为操作接口的 无需训练 空间推理框架。 SpatialClaw 维护一个预加载输入帧以及一套感知和几何基元的有状态 Python 内核,让 VLM 支持的代理根据所有先前的输出每一步编写一个可执行单元,使代理能够灵活地组合和操作感知结果,并使其分析适应中间文本和视觉观察以及每个问题的需求。通过涵盖广泛的静态和动态 3D/4D 空间推理任务的 20 个空间推理基准进行评估,SpatialClaw 实现了 59.9% 的平均准确度,比最新的空间代理高出 11.2 个点,并且在两个模型系列的 6 个 VLM 主干上获得了一致的增益,无需任何基准或模型特定的调整。