论文
半监督视觉-语言-动作模型
Semi-Supervised Vision-Language-Action Model
摘要
视觉-语言-动作(VLA)模型使机器人能够直接根据视觉观察和语言指令预测动作,但使其适应新环境仍然依赖于昂贵的动作标记演示。为了减少这种依赖性,我们研究了有限监督信号下的半监督 VLA 适应,其中只有一小部分轨迹包含机器人动作,其余轨迹提供动作未标记的视觉语言观察。与标准的半监督学习不同,缺失的监督是一种具体的动作信号,必须具有视觉依据、语言一致、物理上可行且时间稳定。为了解决这个问题,我们提出了 SemiVLA,这是一个自我提炼的师生框架,可以从未标记轨迹上的可靠伪动作中学习。 SemiVLA 引入了 VLA 特定的可靠性控制器来评估视觉语言对齐、动作可行性和时间转换一致性,并通过瓶颈预测对齐更新进一步更新教师以避免噪声反馈污染。以 OpenVLA 为骨干,SemiVLA 不断改进 LIBERO 和 CALVIN 的多种 PEFT 策略。在 10\% 标记轨迹下,具有选择性 LoRA 的 SemiVLA 在 LIBERO 上实现了 89.0\% 的平均成功率,比监督 LoRA 好 8.0 个点,而无需额外的推理成本。