论文

建立禁足和弃权的法律奖励模型

Building Legal Reward Models for Grounding and Abstention

模型训练奖励建模与过程监督

摘要

大型语言模型越来越多地用于法律等高风险领域,系统必须将其推理基于检索到的证据,并在证据不足时放弃。然而,现有的奖励模型在很大程度上针对一般偏好而不是上下文基础进行了优化,限制了它们在检索增强生成(RAG)设置中评估这些行为的能力。我们引入了一个框架,用于将现有的法律 QA 数据集转换为上下文偏好数据,并用它来构建 LegalRewardBench (LRB),这是一个在嘈杂和不充分的检索条件下评估扎根法律生成的基准。在一般和法律情境评估中,我们发现情境 DPO 改善了扎根评估,但性能对偏好数据构建很敏感。长度平衡的增强极大地改善了扎根的法律评估,最强大的配置结合了长度平衡的法律和一般上下文偏好数据,并将性能比基线提高了 $\mathbf{+25.6}$pp。我们进一步发现了跨司法管辖区转移的证据:主要根据维多利亚州刑法数据进行上下文精炼的模型改善了对美国外部法律基准的基础评估,包括对 \textsc{住房法规 QA} 的 $\mathbf{+16.2}$pp 改进。总之,这些结果为在检索增强环境中构建和评估扎根的法律奖励模型提供了可重复的基础。