论文

推理者还是翻译者?税法中的污染感知评估与神经符号鲁棒性

Reasoners or Translators? Contamination-aware Evaluation and Neuro-Symbolic Robustness in Tax Law

模型评测模型能力评测

摘要

大语言模型(LLM)的最新进展显著增强了自动化法律推理。然而,其表现究竟反映真实的法律推理能力,还是数据污染的产物,仍不清楚。我们对税法推理方法进行了全面的实证研究,并实现了一套污染检测协议以严格评估LLM的可靠性。我们表明,性能可能因污染而被夸大。在此分析的基础上,我们开展系统评估,将单一LLM与混合系统进行比较,后者把成文法文本翻译为形式化表示并将推理交给符号求解器。我们构建了一套新颖的测试集,通过案例与规则变体探测对未见文档的泛化能力。我们的发现表明,法律推理本质上是组合性的,神经符号框架为法律AI提供了更可靠、更鲁棒的基础,并对未见情形具有更好的泛化能力。

推理者还是翻译者?税法中的污染感知评估与神经符号鲁棒性:论文配图
图2:全部LLM骨干的平均准确率:橙色为Prolog路线、蓝色为直接问答,Original列为SARA其余为对照。