论文
PROSLEX:面向印度司法的专家标注法律条文预测数据集
PROSLEX: A Novel Dataset for Expert-Annotated Legal Statute Prediction for Indian Judiciary
摘要
法律条文预测(Legal Statute Prediction, LSP)是指根据法律文件中的事实描述自动识别相关法律条文,在自然语言处理与信息检索研究中通常被构建为多标签分类任务。尽管近期进展已开始将大语言模型(LLM)用于条文预测,但当前方法主要关注准确率指标,未能回应法律推理这一关键需求——在司法场景中,裁决必须可解释、可论证,法律推理是基本要求。为填补这一研究空白,我们提出PROSLEX(PRediction Of Statutes and LEgal eXplanation),一个包含1,623份印度语境专家标注法律文档的综合数据集。每份文档均配有条文预测与详细解释,共计7,450条解释,刻画了其背后的法律推理。基于该数据集,我们系统评测了多种提示词策略,包括零样本、少样本、思维链与思维树方法,用于生成条文预测及其对应的法律理据。我们的评测框架不仅衡量预测性能,还衡量所生成解释的连贯性与法律有效性,将PROSLEX定位为开发可解释AI系统的基准,既能支持法律从业者,也推动可解释法律NLP研究。为确保可复现性,我们已在GitHub公开PROSLEX数据集与模型代码:https://github.com/subinay494/Legal_Statute_Prediction_Explanation。
