论文

视觉验证支持推理时间引导和自主策略改进

Visual Verification Enables Inference-time Steering and Autonomous Policy Improvement

模型训练强化学习

摘要

部署在现实世界中的机器人应该从经验中学习并随着时间的推移而改进。这需要一种练习和从反馈中学习的机制。在本文中,我们提出了 VERITAS,这是一种用于通用机器人策略的生成器验证器框架,用于推理时策略指导和自我改进。我们使用预先训练的通用机器人策略作为“生成器”,并将其与无梯度“视觉验证器”配对,该验证器在推理时评估动作。该框架支持推理时间引导,无需额外训练即可提高策略性能。我们证明,在没有额外演示数据训练的情况下,推理时间验证的性能始终优于普通通才。此外,我们证明,经过验证的执行轨迹为离线策略改进提供了有效的监督:根据经过验证的自生成轨迹进行微调的策略可以实现一致的性能增益。值得注意的是,我们发现经过验证的 后训练 的效率与专家演示相当,同时不需要人工干预。我们的结果强调推理时间验证是一种实用且可扩展的机制,用于在部署期间改进机器人策略。