论文

StateVLM:用于机器人可供推理的状态感知视觉语言模型

StateVLM: A State-Aware Vision-Language Model for Robotic Affordance Reasoning

模型训练监督微调与指令调优

摘要

视觉语言模型在机器人感知和指令跟踪任务中表现出了强大的性能。然而,他们仍然在精确的空间推理方面遇到困难,特别是在预测物体位置和细粒度物体状态方面。我们提出了 StateVLM,一种视觉语言模型,旨在学习细粒度的对象表示,包括对象定位和抓取相关区域预测。我们引入了一个联合训练目标,它将辅助回归损失(ARL)与标准因果语言模型(CLM)目标相结合,以提高数值推理和空间理解。为了评估模型是否可以超越类别级基础,转向状态感知空间理解,我们引入了一个开源基准,对象状态可供性推理 (OSAR),包括 1,172 个场景、7,746 个单独的对象及其相应的边界框。对引用表达理解数据集的实证实验表明,与仅使用 CLM 相比,集成 ARL 可以提高模型性能。 OSAR 基准测试进一步表明,采用 ARL 的 StateVLM 比仅使用 CLM 训练的模型平均提高了 5.2%。这些结果表明,ARL 对于需要理解对象状态的复杂可供性推理任务特别有益。 StateVLM 中的联合训练目标表明,将辅助回归目标集成到 VLM 训练中可以改善数值推理,并且 OSAR 基准为理解机器人中的对象状态可供性提供了一个新的测试平台。