论文
RoboPIN:经钉定思维链的锚定具身推理
RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought
摘要
具身推理要求模型能够感知物理环境中与任务相关的物体和空间,并在整个多步骤推理过程中保持一致的视觉基础。然而,当前的视觉语言模型依赖于纯文本或坐标增强的思维链,其中实体引用仍然是隐含和模糊的。这可能会导致推理过程与视觉证据脱钩、实体引用跨步骤漂移以及推理轨迹与最终答案之间的因果脱节,并且由于跨视图外观变化,这些问题在多视图场景中进一步放大。为了解决这些问题,我们提出了固定思维链(PinCoT),这是一种结构化推理范式,将每个推理步骤都固定到视觉证据。 PinCoT 引入了推理锚点的概念,它将每个与任务相关的实体绑定到具有实体名称、唯一身份、视图索引和空间基础的结构化视觉锚点,从而实现跨推理步骤和视图的一致实体跟踪。我们构建了一个完全自动化的数据生成管道来构建 PIN-170K,这是一个高质量的 PinCoT 格式的推理数据集。然后,我们通过三阶段的后训练来训练 RoboPIN,逐步注入具体知识、结构化推理能力和过程监督对齐,并在推理过程中直接约束锚定位和身份一致性的奖励。在涵盖体现空间推理、多视图推理和指向的 14 个基准测试中,仅 4B 参数的 RoboPIN 平均超过了 7B 级开源体现模型,比最强的 7B 基准 Mimo-Embodied 平均提高了 12%。进一步分析表明,PinCoT提高了锚定精度和跨步身份一致性,验证了过程监管的有效性。
