论文

OrderGrad:使用订单统计策略梯度估计进行超越均值的优化

OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation

模型训练强化学习

摘要

策略梯度方法通常会优化预期回报,但许多现实世界的应用程序关心回报的分布特性:尾部风险、异常值稳健性或最佳 K 发现。我们引入了 OrderGrad,这是一系列用于阶统计目标的似然比和重新参数化梯度估计器。 OrderGrad 优化有限样本 L 统计量,即排序奖励或成本的加权平均值,通过仅更改排名权重来恢复目标,例如 VaR、CVaR、修剪均值、中位数和 top-m/best-of-K 标准。对于任何固定样本大小和排名权重向量,OrderGrad 为相应的顺序统计目标提供无偏梯度估计器。该方法被实现为一个简单的奖励转换,然后可以在其他标准策略梯度或重新参数化更新中使用。我们研究生成的估计器的方差行为,并在均值优化与部署目标不匹配的任务(包括 LLM 数学 后训练 和其他任务)上对其进行评估。 OrderGrad 提供了一个统一的、即插即用的途径来规避风险、稳健和探索性学习。代码:https://github.com/paavo5/ordergrad