论文

LLM/VLM 强化学习的新鲜度感知优先体验重放

Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning

模型训练强化学习

摘要

强化学习 (RL) 在 后训练 大语言模型 (LLM) 和视觉语言模型 (VLM) 方面取得了令人瞩目的成功,其中 PPO、GRPO 和 REINFORCE++ 等 同策略 算法作为主导范例。然而,这些方法在单次梯度更新后丢弃所有收集的轨迹,导致样本效率低下,对于多轮环境交互成本高昂的代理任务尤其浪费。虽然体验回放通过允许代理重用过去的轨迹并优先考虑信息丰富的轨迹来提高经典强化学习中的样本效率,但直接将优先体验回放 (PER) 应用于 LLM 会失败。十亿参数模型的快速策略演变使得存储的优先级变得陈旧,导致旧的高优先级轨迹在变得无信息后很久仍占据主导地位。我们提出了 Freshness-Aware PER,它通过基于有效样本量分析的乘法指数年龄衰减来增强任何基于 PER 的优先级,从而解决此优先级陈旧问题。据我们所知,Freshness-Aware PER 是第一个成功将 PER 应用于 LLM/VLM 强化学习的作品。我们使用 0.5B、3B 和 7B 模型评估八个多步骤代理、推理和数学竞赛任务。 Freshness-Aware PER 显着优于 同策略 基线,在 NQ Search 上实现 +46%,在 Sokoban 上实现 +367%,在 VLM FrozenLake 上实现 +133%,而没有年龄衰减的标准 PER 始终会降低性能。我们的代码可在 https://github.com/Vision-CAIR/Freshness-Aware-PER 上公开获取。