论文

提示驱动探索:将语言作为VLA强化学习的探索空间

Prompt-Driven Exploration: Language as an Exploration Space for VLA Reinforcement Learning

模型训练强化学习

摘要

探索对强化学习至关重要,策略不能仅靠重复采样偏好的行为得到改善。常规方法在动作空间加入随机性,但通常只得到接近原行为的轨迹;摆脱较弱策略需要动作噪声难以产生的全局变化。大语言模型与视觉—语言—动作模型以自然语言提示为策略条件,因此修改提示可改变整个执行轨迹。难点是初始策略很少成功,稀疏奖励不足以筛选有效提示。 论文提出从执行轨迹本身改进提示:视觉语言模型分析执行视频、诊断策略如何响应,再重写提示以改善下一次行为。该过程类似提示层面的后验采样,模型维护有效提示的隐式分布并根据观察到的轨迹更新。作者称其为提示驱动探索PDE。在操作与推理任务中,PDE使强化学习能够从零奖励初始状态学习成功策略,并改善样本效率。项目见https://xinyunsunshine.github.io/prompt-rl。