论文
RoboAlign:为视觉-语言-动作模型中的语言-动作对齐学习测试时推理
RoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Models
摘要
提升多模态大语言模型(MLLM)的具身推理能力,对于在其之上构建视觉-语言-动作模型(VLA)、从而顺畅地把多模态理解转化为低层动作至关重要。为此,近期工作探索了通过视觉问答(VQA)类型的监督来增强MLLM的具身推理。然而,据报导这些方法会导致VLA性能不稳定,往往只带来微弱甚至为负的收益。本文提出更系统的MLLM训练框架RoboAlign,能可靠地提升VLA性能。我们的核心思想是通过零样本自然语言推理对动作token进行采样,并使用强化学习(RL)对该推理进行精炼,以提升动作准确率。由此,RoboAlign弥合了MLLM中语言与低层动作之间的模态鸿沟,并促进知识从MLLM向VLA迁移。为验证RoboAlign的有效性,我们在MLLM骨干之上添加基于扩散的动作头来训练VLA,并在主流机器人基准上进行评估。值得注意的是,在使用不到1%的数据完成SFT之后再执行基于RL的对齐,RoboAlign在LIBERO、CALVIN和真实环境上分别比SFT基线取得17.5%、18.9%和106.6%的性能提升。
