论文

CROSS:通过几何算子与空间技能修正视频空间推理错误

From Reasoning Failures to Composable Video Spatial Intelligence

智能体系统Agent 工具调用

摘要

空间推理基准覆盖多种视觉语言模型任务,但任务分数无法说明成功或失败来自哪些底层能力。每项任务都需要获取空间证据、表示几何关系并据此推理。本文在共享数据结构和坐标约定下比较预测与真实空间上下文,区分这些能力,发现四类常见错误:感知不准、空间上下文信息缺失、选择错误的测量量,以及参考系、位置或朝向跟踪错误。基于诊断,CROSS把带类型约束的几何算子和空间技能组成免训练工具库,可向不编写代码的视觉语言模型提供核验后的上下文,也可作为SpatialClaw Agent的可调用技能。五项基准测试中,ReVSI平均分由55.9%提高至60.2%,SpatialClaw在DSI-Bench上由62.8%提高至66.3%。结果表明,显式处理空间约定可在无需额外训练的情况下修正系统性推理错误。