论文
JPO:刑事判决预测中结构化法律推理的法律政策优化
JPO: Juris Policy Optimization for Structured Legal Reasoning in Criminal Judgment Prediction
摘要
刑事判决预测需要模型从案件事实中推断出法定条款、指控和量刑结果。与标准分类任务不同,它涉及结构化推理过程,其中法规应与事实相匹配,指控应由法规证明合理,量刑结果应与指控保持一致。现有方法优化最终标签,虽然有些方法试图评估推理质量,但它们的评估是间接的,通常依赖于 LLM 生成的规则,这些规则反映了模型内部偏好,而不是法律裁决的固有逻辑结构。我们提出了 Juris Policy Optimization (JPO),这是一个 后训练 框架,用于中国刑事判决预测中的结构化法律推理。 JPO 首先使用教师生成的理由来监督标准化的四步推理过程,然后应用强化学习,对法律预测质量、推理结构完整性和跨步骤一致性进行综合奖励。 JPO 进一步引入了 词元级 优势重新加权和自适应剪裁,用于法律上显着的推理片段。对多个开源语言模型和三个中国法律基准的实验表明,与有监督的 微调 和强化学习基线相比,JPO 持续提高了判断预测和推理质量。