论文

弃权作为一种行动可以杀死奖励梯度和 KL 锚点:错误惩罚强化学习的崩溃定律和修复

Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning

模型训练强化学习

摘要

错误惩罚评分规则(正确答案为$+1$,错误答案为$-λ$,弃权为$0$)越来越多地针对幻觉而规定:面对这种规则的理性代理在其正确概率超过Chow的阈值$t^\ast=λ/(1+λ)$时准确回答。我们证明 KL 锚定梯度学习器可以做相反的事情。当弃权是一个离散动作时,奖励梯度和锚点的恢复力受到相同的门饱和因素的限制并一起消亡:在明确的条件下(其中,一揽子回答在期望中失去分数并提示共享有限的读数)模型倾向于拒绝一切,其平均训练奖励在训练时间$t$中上升到零,如$1/t$,因此曲线显示为改进,而覆盖范围崩溃。优势估计器加剧了失败:在其稀疏答案机制中,组标准化默默地将每个设计的惩罚替换为有效惩罚 1,将学习阈值从 $t^\ast$ 移动到 $1/2$。修复是结构性的:使用严格适当的分数加上正确性奖励来训练强制性置信度报告,并且仅在部署时通过阈值设置报告来放弃。始终发出的报告没有饱和之门,因此没有共享因素可以一起杀死其奖励梯度和锚定,并且其校准的最佳值很有吸引力。模拟证实了每一个预测,两个尺度的语言模型实验证实了该机制的存在:规则压制了模型在十个优化器步骤内仍然可以解决的问题,消融隔离了原因,报告级训练同时提高了覆盖率、准确性和校准。