论文

TraAct:通过视觉轨道桥接机器人控制和视觉预测

TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks

智能体系统Agent 规划

摘要

机器人动作本质上是特定于实施例的,并且与图像空间视觉变化的一致性很弱,限制了它们作为机器人世界模型的条件信号的有效性。相比之下,视觉轨迹提供了与任务相关的点如何在场景中移动的与实施例无关的表示,为准确且空间精确的未来视频预测提供了密集的图像空间指导。基于这一观察,我们提出了 TrAct,一个基于世界模型的机器人决策框架,它使用视觉轨迹作为控制和预测之间的中间接口。 TrAct 由三个部分组成:视觉-语言-动作和轨迹模型(VLAT),根据当前观察和语言指令联合预测候选动作和相应的视觉轨迹;轨道条件世界模型(TWM),可预测以拟议轨道为条件的未来视觉结果;以及对预测结果进行评分的视觉语言奖励模型(VLAC)。在推理时,VLAT 生成候选动作轨迹对,TWM 推出其视觉结果,VLAC 选择预测结果最能满足指令的轨迹;然后机器人执行与所选轨迹配对的动作。对所提出的 LIBERO-INTEGRAL 基准和现实世界 Franka 操作的实验表明,与强 VLA 基线 $π_{0.5}$ 相比,TrAct 将模拟中的成功率从 27% 提高到 55%,将现实世界任务的成功率从 49% 提高到 76%。此外,TWM 持续提高了动作条件世界模型 (AWM) 的视频预测质量。这些结果表明,视觉轨迹在机器人控制和视觉预测之间提供了有效的共享接口,从而实现更准确的世界建模和更强的机器人泛化。