论文

被引用但未被咨询:法律思维链忠实性的反事实审计

Cited but Not Consulted: A Counterfactual Audit of Legal Chain-of-Thought Faithfulness

模型评测模型行为与机制分析安全与风险评测

摘要

大型语言模型越来越多地通过命名判决背后的法规或先例来证明法律判决的合理性,并将其视为判决所依据的证据。我们直接测试这一点:在固定案例事实的情况下,我们用指定的法律权威替换不相关的法律权威,并从模型的隐藏状态解码模型不断演变的判决。在七个开放权重模型 (8B-70B) 和跨越司法和合同推理的四个基准中,当明确要求通过指定管理机构来证明判决的合理性时,模型在 66.7%-100% 的代中指定正确的机构,而当机构变更时判决发生变化的一致性要差得多:CaseHOLD 为 0.0%-21.7%,ECHR 和 SCOTUS 为 30.0%-76.7%,以及ContractNLI 为 43.3%-50.0%。无论是规模还是专门构建的法律推理模型(尽力而为的 LoRA 复制;第 6 节)都无法弥补这一差距。对五个核心模型的红队评估发现,对隐藏在案例事实中的对抗性指令的遵守程度(73.3%-96.4%)大大超过了判决交换敏感性,在整个模型中无一例外地成立 排名。因此,指定法律权威并不能很好地体现判决对其的依赖程度,而同一判决仍然容易受到对抗性操纵。这两项发现在排除即时措辞噪音和混杂抽样的检查中得到重复,并直接影响到将生成的法律解释用作合规或审计假象。