论文

通过价值梯度流强化学习

Reinforcement Learning via Value Gradient Flow

模型训练强化学习

摘要

我们研究行为正则化强化学习(RL),其中针对参考分布(离线 RL 中的数据集或 LLM RL 微调中的基本模型)的正则化对于防止错误的分布外外推导致的值过度优化至关重要。现有的方法要么依赖于重新参数化的策略梯度,这很难扩展到大型生成模型,要么依赖于拒绝采样,当试图超越行为支持时,这可能过于保守。在本文中,我们提出了价值梯度流(VGF),这是一种可扩展的行为正则化强化学习的新范式。 VGF 将行为正则化强化学习视为最优传输问题,将参考分布映射到价值诱导的最优策略分布。我们通过离散梯度流解决这个传输问题,其中值梯度引导从参考分布初始化的粒子。我们的分析表明,VGF 通过控制运输预算隐含地实施了正规化。 VGF 消除了显式策略参数化,同时保持了表现力和灵活性,这可以通过调整传输预算来实现自适应测试时间扩展。大量实验表明,VGF 显着优于现有方法,在离线 RL 基准(D4RL、OGBench)和 LLM RL 任务上取得了最先进的结果。代码和运行可以在 https://ryanxhr.github.io/vgf 找到。