论文
琐碎纠正的内生奖励
Triviality Corrected Endogenous Reward
摘要
开放式文本生成的强化学习由于缺乏可验证的奖励而受到限制,因此必须依赖需要注释数据或强大的闭源模型的判断模型。受到最近使用基于置信度的内源奖励进行数学推理的无监督强化学习工作的启发,我们研究了这一原理是否可以适用于开放式写作任务。我们发现直接应用信心奖励会导致琐碎偏差:政策向高概率输出崩溃,减少多样性和有意义的内容。我们提出了 TCER(琐碎校正内生奖励),它通过奖励专业策略和通才参考策略之间的相对信息增益来解决这种偏差,并由概率相关的校正机制进行调节。在多个编写基准和模型架构中,TCER 在没有外部监督的情况下实现了一致的改进。此外,TCER 还有效地转移到数学推理,验证了我们的方法在不同生成任务中的通用性。