论文

并行仿真中机器人操作的扩展视觉语言奖励学习

Scaling Vision-Language Reward Learning for Robot Manipulation in Parallel Simulation

模型训练奖励建模与过程监督

摘要

视觉语言模型 (VLM) 可以在基于偏好的奖励学习中取代人类注释者,但顺序 API 请求和单一环境数据收集使得训练缓慢且成本高昂。我们提出了 RAPID(自适应并行图像多样性奖励学习),这是一个将 GPU 并行部署与数据感知策略更新、单请求偏好标记、自动奖励稳定和代表性图像采样相结合的系统。我们在 IsaacLab 中的五个 Franka Panda 操作任务中评估了这些组件。并行轨迹采样和自适应更新首次大幅减少了训练时间:在匹配的两阶段提示下,平均运行时间从 9.18 小时降至 3.13 小时。启用所有 RAPID 组件后,每次运行使用 896 个 API 调用(而不是 19,840 个 API 调用)在 1.15 小时内完成训练,并且总体最终成功率从 86.3\% 上升到 98.7\%。这意味着端到端加速提高了 8.0$\times$,API 使用量减少了 95.5\%。使用 Gemma~3 12B 和 GPT-4.1 mini 进行的离线评估表明,单个请求提示可减少两种模型的标记延迟和成本。代码可在以下位置获得:此 https URL。