论文

RHyVE:针对 LLM 生成的奖励假设的能力感知验证和阶段感知部署

RHyVE: Competence-Aware Verification and Phase-Aware Deployment for LLM-Generated Reward Hypotheses

模型训练奖励建模与过程监督

摘要

大语言模型 (LLM) 使强化学习中的奖励设计显着更具可扩展性,但生成的奖励并不是自动可靠的训练目标。现有的工作主要集中在生成、演化或选择奖励候选者上,而很少关注在策略优化期间何时可以验证和部署这些候选者。我们通过将生成的奖励视为奖励假设来研究这个部署时间问题,其效用取决于当前策略的能力和训练阶段。我们提出 \textsc{RHyVE},一种能力感知验证和阶段感知部署协议,它使用短视野分叉验证来比较来自共享策略检查点的小组奖励假设。我们的实验表明,奖励排名在能力较低时并不可靠,但在达到任务相关阈值后会变得信息丰富。在稀疏操作任务中,阶段感知部署可提高锁定协议下的峰值和保留性能。更新的 LLM 生成的奖励候选实验显示了候选家族相关的行为:生成的池可以表现出阶段相关的获胜者变化,但没有固定的预热时间表是普遍最佳的。保留的调度选择、保守的选择器基线、计算匹配的控制和规模控制进一步表明 \textsc{RHyVE} 最好被理解为一种基于验证的部署协议,而不是通用调度程序。密集和全失效边界实验界定了该方法的范围。总之,这些结果表明奖励生成和奖励部署应作为耦合问题来研究:生成的奖励必须在不断变化的政策能力下进行验证和部署。