论文
从偏好到原则:基于评分标准的基础知识答案对齐
From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers
摘要
为开放域问答设计有效的奖励信号具有挑战性,因为高质量的响应必须同时满足答案质量的多个方面,而这些方面很难用整体标量目标来捕获。我们引入了一个基于评分标准的奖励框架,该框架根据检索到的证据生成特定于查询的评分标准,并分解为多个质量维度,从而在 后训练 期间提供细粒度的监督。在三个评估轴(构图、基础和指令遵循)上进行平均,我们的方法比指令调整的基线提高了 6.5%,比平坦的标题变体提高了 4%,并且在所有评估数据集上都获得了一致的增益。根据检索到的证据调整评分标准可以提高事实支持,同时将评分标准分解为特定于质量的维度进一步提高连贯性、组织性和对查询要求的遵守。我们的结果表明,扎根的多维评分标准为复杂的开放领域问答提供了更有效的奖励监督。