论文

知形而非功能:自动审核答案--法律基准中的权力脱钩

Knowing the Form, Not the Function: Automatically Auditing Answer--Authority Decoupling in Legal Benchmarks

模型评测评测方法与指标

摘要

即使模型也规定了法律权威,法律基准通常也会得出最终答案。我们测试答案的正确性是否可以作为权威基础的代理。在不要求法定引用的普通推理提示下,四个 LLM 自发地生成了 238 个台湾律师考试项目的权威标记。由于每个项目都有经过验证的管理条款,因此我们会自动联合审核答案的正确性和权威依据。两个维度在两个方向上分离。在刑法中,24.0--42.4\%的有效答案是答案正确,但错过了标准法律依据,而15.2--21.7\%的答案是错误的,但引用了它。单独的法定检索调查和允许的引用-弃权干预进一步表明,答案和引用行为可以在输出层面上分开移动。由于这种不匹配的出现没有出现对抗性或不一致的提示,因此仅答案评分将自然发生的标准法律依据失误视为完全的基准成功。由于法律依据在结构上是可提取的且可在外部验证,因此可以自动测量故障。初步的中华人民共和国民法延伸还遵守未经请求的引用权威标记,从而推动全面的跨司法管辖区联合审计。因此,我们提出联合答案——对基于法规的法律基准的权威评估。