论文
SpatialCLI:学会借助空间工具推理,进而摆脱工具推理
SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them
摘要
视觉语言模型(VLM)越来越多地被用于具身智能体,以解读视觉输入、推理空间关系,并基于该推理做出任务级决策。然而,一种根本性的能力错配依然存在:通用VLM能对整体任务进行推理,却常遗漏决定成败的视觉细节;而专用视觉模型能捕捉这些细节,却无法将其转化为任务级决策。在本工作中,我们提出SpatialCLI,一个教VLM借助空间工具推理并逐步内化这些工具所提供的专用感知能力的框架。SpatialCLI分三个阶段进行:(1)Call将专用视觉模型暴露为空间工具,以增强VLM的感知;(2)Learn使用Cold-Start SFT与智能体强化学习(RL)改进工具使用;(3)Internalize将成功的工具使用轨迹转化为语言表述,从而内化专用感知能力。我们进一步提出SpatialCLI-Bench,一个包含516个样例、覆盖定位、分割、深度与姿态的组合感知基准。在MindCube上,SpatialCLI将Qwen3-VL-8B-Instruct带工具时的成绩从29.3%提升至84.6%,超过带工具的GPT-5.6 Sol(72.1%),内化后在无工具情况下仍保持73.8%。
