论文
ChronoGraph:具有视觉语言模型的功能 4D 场景图,用于交互理解和基础规划
ChronoGraph: Functional 4D Scene Graphs with Vision-Language Models for Interaction Understanding and Grounded Planning
摘要
具身Agent必须确定在哪里行动,预测由此产生的场景变化,并解释观察到的结果以指导后续行动。这需要将 4D 交互理解(解释过去的行为如何改变场景)与基于空间的规划(确定如何以及在何处实现目标)联系起来,并预测由此产生的场景变化。我们引入了 ChronoGraph,这是一种功能性 4D 场景图,它将可供性部分上的操作与语义和几何状态变化联系起来。通过以相同的形式表示观察到的和预期的转变,它为理解和规划提供了共享的基础。我们通过自动数据引擎构建 ChronoGraphBench,该引擎将人类交互视频和模拟机器人轨迹转换为图形注释问题,以便在这两项任务上训练和评估视觉语言模型 (VLM)。使用这些注释,我们通过分两个阶段调整预训练的 VLM 来训练 ChronoGraphVLM。图作为思维链的监督微调教会模型在回答之前重建观察到的转变并以图迹的形式预测未来的转变。随后的联合4D图强化学习直接奖励图属性和答案正确性。跨模型规模的实验表明,相对于相应的预训练基线和零样本传输到 VLM4D 的改进。现实世界的演示进一步表明,基于图形的规划和可供性grounding支持通过现有的机器人技能进行移动操作,而无需额外的微调。