论文
DistAL:基于距离的优势学习,用于 VLA 微调
DistAL: Distance-based Advantage Learning for VLA Fine-Tuning
摘要
近年来,视觉-语言-动作模型(VLA)通过将大语言模型的语义理解与流匹配策略的精确控制相结合,改变了机器人操作领域。优势条件是一种最新技术,它通过在部署数据上训练价值函数并使用它来训练优势条件策略来迭代改进 VLA。以前的工作仅应用了简单的、低信息的成功/失败奖励,这使得价值函数无法区分任务出现的不同质量的状态。在对分布外(OOD)检测方法的探索的推动下,我们引入了基于距离的优势学习(DistAL),它通过使用嵌入空间距离作为奖励,产生信息更丰富的价值函数,从而产生更高的下游任务成功率。我们在真实硬件上的一系列模拟基准和灵巧的双手操作任务上验证了我们的方法。