论文

以空间潜推理理解具身指向关系

Spatial Latent Reasoning for Embodied Reference Understanding

模型推理模型训练应用与实践监督微调与指令调优推理策略与问题分解视觉感知与空间理解

摘要

指向手势视觉基础需要将手的几何形状与所指对象的视觉识别和范围联系起来。连续潜在推理的一个核心挑战是如何将这些补充线索组织成有用的中间监督。我们提出了空间潜在推理(SLR),这是一个围绕几何和视觉状态的有序序列构建这种监督的框架。空间射线状态由指尖位置和指向方向监督,然后是与目标区域特征对齐的四个状态。为了构建视觉目标,我们引入了奇偶池化,它将多相分组应用于四个交错空间支持上的平均区域标记。所有状态都是在训练和推理过程中循环生成的;仅在训练期间需要辅助注释。在 EgoPoint-Ground 上,该框架相对于 Qwen3.5-4B、Qwen2.5-VL-7B 和 Qwen3-VL-8B 上的同主干监督微调,分别将 mIoU 提高了 2.8、17.5 和 21.1 个百分点,并且在两个硬子集上都有改进。在 YouRefIt 上,它在 IoU 0.5 时达到了 77.6% 的精度,比不同评估协议下报告的最新技术水平高出 5.2 个百分点。消融支持对标准和相似对象集的联合几何和视觉监督,并支持标准集上三个替代池算子的奇偶校验。这些结果支持连续指向Grounding的任务结构监督。我们将发布代码和支持材料。

以空间潜推理理解具身指向关系:论文原图
图 2:SLR 概述。 (a) 冻结视觉编码器和合并提供图像特征。因果MLLM在其隐藏空间中生成五个循环状态,然后解码目标框; ss 和 ee 表示潜在边界标记。 (b) 空间读数预测指尖位置和指向方向,而视觉状态与具有停止梯度的奇偶池区域特征对齐。辅助读数和注释仅用于训练。射线叠加和网格是示意性的;读数尺寸对应于Qwen3.5-4B。