论文

具有多个偏好预言机的离线约束 RLHF

Offline Constrained RLHF with Multiple Preference Oracles

模型训练偏好优化

摘要

我们通过多个偏好预言机研究来自人类反馈的离线约束强化学习。受以安全或公平来权衡性能的应用程序的推动,我们的目标是在最小受保护群体福利约束的情况下最大化目标人群效用。根据参考策略下收集的成对比较,我们通过最大似然估计特定于预言机的奖励,并分析统计不确定性如何通过双计划传播。我们将约束目标转换为 KL 正则化拉格朗日量,其原始优化器是吉布斯策略,将学习简化为凸对偶问题。我们提出了一种仅对偶算法,可确保高概率约束满足,并为离线约束偏好学习提供第一个有限样本性能保证。最后,我们扩展了理论分析以适应多重约束和一般的 f 散度正则化。