论文
CRAwLeR——交叉引用感知法律检索
CRAwLeR -- Cross-Reference Aware Legal Retrieval
摘要
上下文感知块检索的现有基准在很大程度上依赖于重新调整用途的任务项,并且很少证明它们的查询真正需要上下文,这使得分数解释变得困难。我们专注于一种特定类型的上下文依赖,即法律交叉引用,并引入 CRAwLeR,这是一种狭隘的、定义明确的现象的操作化:交叉引用感知上下文利用,用于法律文档中的块检索。我们的管道检测合法的交叉引用,识别查询候选,将目标块链接到其相关上下文,使用 LLM 生成上下文要求的查询,并通过对抗性非上下文基线和保证提示过滤它们。我们发布了使用此流程构建的 CRAwLeR-DK 和 CRAwLeR-PL、丹麦和波兰数据集,以及强大的人择风格情境化基线。手动分析发现,大约 80% 的随机采样查询真正针对标记的目标块并需要上下文,失败遵循系统和命名模式。基准测试很困难,但尚未解决:best Recall@10 在 CRAwLeR-DK 上达到 55%,在 CRAwLeR-PL 上达到 59%。消融和失效分析将剩余差距归因于上下文 LLM,而不是 检索器。即使目标在前十名中被检索到,标记的上下文块通常也会超过它。我们是第一个用于上下文感知块检索的数据集,可以仔细考虑构造有效性并根据如此狭窄的、定义明确的现象检查我们的结果。