论文
GADR:主张审计以生成可验证的法律答案
GANDR: Claim Auditing for Verifiable Legal Answer Generation
摘要
在法律实践等高风险领域,语言模型答案只有在读者可以根据系统引用的来源验证每项主张时才有用。目前的基于证据生成管道对答案进行整体评分,因此正确的结论可以依赖于捏造的或松散匹配的引用,并且仍然得分很高。缩小这一差距需要为每个主张验证而构建的系统以及对其进行衡量的评估。我们引入了 GANDR(Grounded ANswer DRafter),这是一个双代理系统,其中起草者以结构化的法律推理格式编写答案,而独立的批评者与人类验证者具有相同的观点,根据其引用的来源审核每个声明,并在每一轮中发出每个声明的审计跟踪。我们将其与严格的正确性标准配对,要求每次引用都解析为 检索器 返回的段落。在所有六个系统共享一个主干、一个检索表面和一个引文指令的 185 项法律基准中,GANDR 在每个主要指标上均排名第一,达到 70.8% 的严格准确度,领先最强基线 11.3 个百分点 (p<0.01)。恢复协议锚定的提交规则会使严格准确度降低 22.7 个点,并且严格领先优势在另外三个主干上保持正值,为 +3.2 到 +6.5 个点。此线索可追溯到 Drafter 配置和协议锚定提交,而不是重写。针对两名受过法律培训的注释者,审计将 F1 0.84 的支持不足的主张标记为二元检测器,而其四向判决标签仅较弱地同意并且是建议性的。 Code is available upon request.