论文
ReFineVLA:通过教师指导的多模态推理感知通才机器人策略 微调
ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning
摘要
视觉-语言-动作(VLA)模型因其在将带有语言指令的多模态观察结果转化为所需的机器人动作方面的优势而受到了研究界的广泛关注。尽管取得了进步,但 VLA 经常忽视显式推理并学习功能输入-动作映射,从而省略关键的逻辑步骤,这在复杂、长期操作任务的可解释性和泛化方面尤其明显。在这项工作中,我们提出了 ReFineVLA,这是一种多模态推理感知框架,可以根据教师指导的原因对 VLA 进行微调。我们首先使用专家教师模型生成的推理原理来增强机器人数据集,指导 VLA 模型学习推理其行为。然后,我们使用 ReFineVLA 与推理丰富的数据集对预训练的 VLA 进行微调,同时保持底层的泛化能力并提高推理能力。我们还进行注意力图可视化来分析 ReFineVLA 的视觉观察、语言提示和待执行动作之间的一致性,反映模型专注于相关任务和动作的能力。通过这一额外步骤,我们探索 ReFineVLA 训练的模型在视觉语言和动作领域之间表现出有意义的一致性,突出了增强的多模态理解和泛化。通过在 SimplerEnv 上使用 WidowX 和 Google Robot 任务进行的一系列模拟操作基准测试进行评估,ReFineVLA 实现了最先进的性能,其成功率超过了 WidowX 基准测试和 Google Robot Tasks 上第二好的方法。