论文
后训练被忽视的免费午餐:LLM代理商的进步优势
Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents
摘要
过程奖励模型能够对 LLM 进行细粒度、步骤级的评估,但为代理设置构建它们仍然非常困难:长视野交互、不可逆动作和随机环境反馈使得人工注释和蒙特卡罗估计在规模上都不可行。在这项工作中,我们表明强化学习(RL)后训练 已经提供了有效的步骤级评分的要素,完全消除了对专用奖励 模型训练 的需要。具体来说,我们在一般随机马尔可夫决策过程下得出隐式优势,我们将其称为进步优势——强化学习训练的策略与其参考策略之间的对数概率比准确地恢复了最优优势函数。该公式使得生成的信号无需注释、与域无关,并且可作为标准 RL 后训练 管道的副产品。我们在三个不同的应用程序中验证了进度优势的有效性:五个基准和四个模型系列的测试时间缩放、不确定性量化和故障归因。在所有设置中,它始终优于基于置信度的基线,并且尽管不需要特定于任务的训练,但超过了专门训练的奖励模型。我们通过对进步优势特征进行更深入的分析来补充这些结果,为在现实世界的代理系统中采用提供实用指导。