论文
重新思考 VLA 初始化的 VLM 表示
Rethinking VLM Representation for VLA Initialization
摘要
视觉语言动作 (VLA) 模型广泛采用预训练的视觉语言模型 (VLM) 作为策略骨干,但目前尚不清楚哪种预训练的 VLM 表示可用作 VLA 初始化。在本文中,我们将 VLA 初始化研究为沿着三个轴的受控表示设计问题:能力级体现的 VQA 监督、参数更新策略和机器人数据预训练。我们的实验表明,原始的预训练 VLM 表示是动作性能的关键来源。然而,具体的VQA自适应并不能产生统一的收益:它的收益取决于下游瓶颈,并且来自不同能力域的收益不是简单相加的。对于更新策略,LoRA 提供了比 Full Finetune 更可靠的初始化,这表明过度重塑预训练表示会削弱 VLA 初始化。机器人数据预训练进一步改进了 VLA 初始化,通过基于 LoRA 的分阶段训练获得了最强的变体。总之,这些发现表明,有效的 VLM 到 VLA 适应应该注入与动作相关的体现信号和机器人轨迹信号,同时保留对动作学习仍然有用的预训练 VLM 表示。