论文
最后:通过 Gromov-Wasserstein 对齐桥接视觉、语言和动作流形
LAST: Bridging Vision-Language and Action Manifolds via Gromov-Wasserstein Alignment
摘要
我们对视觉-语言-动作(VLA)学习采取 Gromov-Wasserstein 的观点,其目标是使动作表示的关系几何与 VL 嵌入的语义几何兼容。然而,由于领域之间的数学异质性,这种对齐是不平凡的:视觉语言的语义空间是拓扑线性的和各向同性的,而机器人动作的物理流形是非欧几里得的和各向异性的。它们不相交的度量结构使得直接回归不适定。为了解决这种不兼容性,我们引入了 LAST(李代数动作空间分词器),它通过两阶段变换重建动作空间以建立与 VL 模态的局部度量兼容性:(1)全局拓扑线性化:通过李代数映射线性化动作流形,将轨迹转换为固定长度的物理加性表示。 (2)局部度量离散化:将表示分层离散化为模式和白化残差,产生与语义度量在统计上一致的近似各向同性的局部图表。通过解决全局和局部层面的结构不匹配问题,LAST 使 VLA 模型具有卓越的收敛性和泛化性。