论文

VLLR:为长程机器人任务构建可泛化的密集奖励

Generalizable Dense Reward for Long-Horizon Robotic Tasks

模型训练奖励建模与过程监督

摘要

现有机器人基础策略主要通过大规模模仿学习训练,但长程任务中的分布变化与误差累积仍会影响表现。强化学习可用于微调,然而跨任务应用常需人工设计奖励。本文提出VLLR密集奖励框架,结合大语言模型和视觉语言模型识别任务进度所提供的外在奖励,以及基于策略自确定性的内在奖励。大语言模型将任务拆为可核验子任务,视觉语言模型估计进度,并仅在短暂预热期初始化价值函数,以免整个训练过程承担高额模型推理成本。策略自确定性在PPO微调中持续提供逐步指导。消融显示,视觉模型价值初始化主要改善任务完成效率,自确定性主要提升成功率,尤其在分布外任务上。在涵盖移动操作与导航的CHORES中,相对预训练策略成功率最高提高56个百分点;相对所比较的先进强化学习微调方法,分布内和分布外任务最高分别提高5%与10%。全程无需人工设计奖励。更多可视化:https://silongyong.github.io/vllr_project_page/。