论文

ATI-VLA:通过可操作的对齐然后自适应注入以动作为中心的预测视觉-语言-动作模型

ATI-VLA: Action-Centric Predictive Vision-Language-Action Models via Actionable Alignment Then Adaptive Injection

摘要

预测视觉-语言-动作(VLA)模型旨在通过未来观察或世界动态预测来改进机器人操作。然而,现有的方法往往无法实现这种潜力并且表现不佳直接行动预测模型。我们认为,这些限制源于观察和行动之间的模式不一致,以及导致学习偏离以行动为中心的目标的联合优化冲突。为此,我们引入了 ATI-VLA,这是一种通过可操作对齐然后自适应注入的以动作为中心的预测视觉-语言-动作框架。具体来说,它遵循两步设计:1)通过共享代码本进行可操作的表示对齐。它通过统一的码本将两种模态映射到共享的离散潜空间,从而使预测观察和动作表示对齐,从而使预测观察潜在可轻松用于动作生成并减轻模态错位。 2)以行动为中心的预测潜伏的自适应注入。在此基础上,它然后通过轻量级自适应侧路径将预测观察潜伏作为显式预测先验注入到动作解码中,从而在单个以动作为中心的目标下实现自适应预测指导。对模拟和现实世界机器人任务的大量实验表明,ATI-VLA 通过更快的收敛实现了最先进的性能。