论文

提示优于微调:用生成式期望值为法规解释语句排序

Prompting Beats Fine-Tuning: Generative Expected Value Scoring for Statutory Term Retrieval

摘要

法规中的法律概念经常使用模糊的术语来表达,实践者经常求助于判例法来解释它们。我们研究了根据判例法句子解释概念或目标法定术语的有用性对判例法句子进行排名的任务,使用了包含 26,959 个句子的既定数据集,涵盖 42 个美国法典概念,并标记为四个解释价值类别。我们比较了两种方法:(i)仅编码器模型(ModernBERT)的监督 微调 和(ii)仅解码器模型的零样本提示。我们表明,在所有概念和标准 NDCG 截止值中,ModernBERT 在很大程度上与早期的 BERT 系列基线相匹配。相比之下,仅提示解码器模型实现了最强的整体有效性,我们最好的系统超越了之前报告的该任务的所有最先进结果。