Chronos:非马尔可夫长视野操纵的物理学全历史框架
Chronos: A Physics-Informed Full-History Framework for Non-Markovian Long-Horizon Manipulation
摘要
通用机器人策略应该建模为动态系统,但许多 VLA 和生成模仿策略仍然依赖于当前的观察或短窗口。这种马尔可夫捷径在依赖记忆的操作中失败了:相同的观察可能需要在不同的历史之后采取不同的行动。我们提出了 Chronos,一个基于物理的全历史框架,用于非马尔可夫长视界操纵。关键思想是将观察历史从辅助背景提升到政策动态的潜在状态。在每个物理控制步骤中,Chronos 通过融合观察和本体感觉形成一个状态代表词元,因此词元序列与物理时间一对一对齐。选择性状态空间模型传播这种因果历史状态,它通过隐式最大似然估计 (IMLE) 先验条件多模态粗动作。然后,这个先验通过二阶薛定谔启发的桥进行改进,该桥可以预测加速度场,从而产生更平滑、更符合物理规律的的机器人运动。通过 16 个模拟任务和 4 个真实世界实验,Chronos 在精确插入、一般操作和依赖于内存的长范围控制方面进行了评估。在 RMBench 上,成功需要记住任务阶段,Chronos 实现了 73.6% 的平均成功率,比马尔可夫 VLA 基线 pi0.5 高出 62.4 个百分点,相对增益为 6.6 倍,同时使用的参数减少了 10 倍。它还比内存 VLA Mem-0 高出 22.8 个点,同时使用的参数减少了 30 倍以上。在使用单个 RGB 摄像头的现实双臂实验中,Chronos 在四项任务上取得了 78% 的平均成功率,其中在三项依赖于内存的任务上取得了 72% 的成功率,而 pi0.5 在总体上取得了 7% 的成功率,在依赖于内存的子集上取得了 0% 的成功率。这些结果表明,历史不应被视为辅助背景,而应被视为操纵政策的潜在状态。