论文

LJP从未见过的案例:起诉决定预测以实现更完整的刑事责任评估

The Cases LJP Never Sees: Prosecution Decision Prediction for More Complete Criminal Liability Assessment

模型评测基准与评测资源

摘要

法律判决预测(LJP)已成为评估刑事法律领域人工智能的核心基准,但它只看到已经通过检察审查并被正式起诉的刑事案件。因此,自由党在刑事责任评估上留下了很大的盲点,忽视了证据不足、没有刑事责任或免予处罚的案件。为了填补这一空白,我们提出了\textbf{起诉决策预测(PDP)},这是第一个围绕检察审查构建的法律人工智能任务,它将每个案件分类为起诉或三个不起诉决定之一,并反映了法律人工智能在证据评估、法律包容和基于价值的自由裁量权方面的能力。我们进一步构建了 \textbf{PDP-Bench},这是涵盖 190 项指控的 4{,}630 项真实的中国检察决定的基准。大量实验表明,最先进的 LLM 在 PDP 上的表现比在 LJP 上的表现要差得多,并且主流增强路线无法缩小差距。此外,受控的 RLVR 干预表明,简单的结果奖励无法产生普遍的 PDP 歧视。