论文

从拒绝到丰富:长期幻觉强化学习的红字奖励

From Refuse to Richness: Rubric Rewards for Long-Form Hallucination Reinforcement Learning

模型训练奖励建模与过程监督

摘要

对无依据主张施加惩罚,可以提高长篇生成的证据一致性,但也可能使模型回答得更少。本文研究长篇回答强化学习中的拒答与信息丰富度权衡。研究不以长度、主张数量、细节或成对相关性作为整体信息量的代理,而是为每个问题制定要点评分标准,列明有用回答必须和可以覆盖的信息。这些标准直接定义信息覆盖,同时用于评估和奖励。比较仅证据一致性、代理指标、仅要点覆盖与组合奖励后发现,严格的证据一致性奖励提高支持程度却压低覆盖,无约束的覆盖奖励增加信息量却削弱证据支持。证据一致性、要点覆盖与相关性的软组合,在实验中实现最佳平衡,改善分布内证据支持,并比两类单独奖励更好地迁移到分布外检查清单任务。