论文

无推理成本的推理:机器人 VLA 策略的潜在语义支架

Reasoning Without Inference Cost: Latent Semantic Scaffolding for Robot VLA Policies

模型训练预训练

摘要

视觉-语言-动作 (VLA) 模型通过模仿进行训练,并捕捉要采取的动作,但不捕捉原因;添加因果推理可以改善操作,但当前的方法是在推理时付出代价的——生成推理词元或在每一步推出预测的未来状态,这种成本在长期内会增加。我们询问是否可以在训练期间捕获这种好处并在部署之前丢弃。我们引入了潜在语义支架(LSS),这是一种在人类演示预训练期间应用的辅助损失,它通过一个小投影头将 VLA 的动作标记表示与物理推理原理的文本嵌入对齐。推理时头部被丢弃,使得未修改的基本策略具有零附加成本。我们的中心发现涉及对齐粒度:将每个操作标记与其自身操作阶段(密集 LSS)的基本原理对齐,而不是与单个池化情节级嵌入(池化 LSS)对齐,可以产生明显更好地转移到保留任务的表示。密集 LSS 既实现了最佳的分布内成功,又实现了对对齐过程中未见过的任务的最佳转移,而池化对齐则过度专业化于训练任务。代表性探针显示,密集 LSS 在主干中产生大约两倍的每相可分离性,支持相位局部对齐是其运行机制。