论文

我们说的谎言:通过切线空间上的分数匹配来纠正视觉语言动作策略中的欧几里得谬误

The Lie We Tell: Correcting the Euclidean Fallacy in Vision Language Action Policies via Score Matching on Tangent Space

摘要

基于扩散的视觉-语言-动作策略在机器人操作方面取得了显着的成功,但犯了一个基本的几何错误,我们称之为$\textbf{欧几里德谬误}$:将SE(3)表示为平坦的$\mathbb{R}^{12}$向量。这种近似会导致 (1) 违反 SO(3) 约束的流形漂移,(2) 坐标变换下破坏的等变性,以及 (3) 运动学成本过高的非测地线轨迹。我们引入 $\textbf{Lie Diffuser Actor (LDA)}$,一个本质上在 SE(3) 上运行的扩散框架。我们的方法通过左不变 SDE 注入噪声,预测切线空间中的分数,并通过指数图收回样本。该公式通过构造消除了流形漂移,同时保证了坐标系等效性和测地线最优性。在 CALVIN ABC$\rightarrow$D 上,LDA 将平均任务长度从 $3.27$ 提高到 $3.51$ ($+7.3\%$)。我们进一步在真实机器人上验证我们的方法,结果表明我们的方法在大多数任务上优于基线。