论文

LexReward:分类驱动的法律语言模型奖励框架

LexReward: A Taxonomy-Driven Reward Framework for Legal Language Models

模型训练奖励建模与过程监督

摘要

法律语言模型需要奖励信号,不仅要捕获答案的正确性,还要捕获法律响应的多维质量。然而,现有的奖励方法通常依赖于粗粒度的整体判断,提供有限的领域特异性和可解释性。我们引入 LexReward,一个用于法律奖励建模的分类驱动框架。 LexReward 从三个互补的维度描述法律答复质量: 风格,涵盖词汇和句法质量;要素,评估法律主体、事实、法规和决定;链,评估法律推理的顺序、完整性、正确性和非冗余性。对于每个维度,我们都制定了细则,规定了评估标准和质量水平。所得奖励用于构建直接偏好优化 (DPO) 和奖励模型训练的成对偏好数据。实验表明,基于标题的奖励能够可靠地区分不同质量的法律响应,并且基于偏好数据的 DPO 训练可以提高所有三个维度的性能。学习到的奖励模型 LexRM 还支持有效的下游优化:每个特定维度的奖励模型通过强化学习提高其相应维度的策略性能,而无需在奖励时参考答案。维度分析进一步支持了所提出的分类和奖励构建的有效性。