论文

解决与验证:捕捉税务推理系统中的矛盾

Solving versus Verifying: Catching Contradictions in Tax Reasoning Systems

模型推理推理验证与自校正

摘要

大语言模型 现在可以在法定基准中计算 90% 以上格式良好的案例的正确纳税义务,这使它们成为直接使用此类答案的税务咨询和合规系统的候选者。然而,真正的法律输入常常是有缺陷的:缺少必要的事实,或者陈述的事实相互矛盾。干净基准的准确性并不能说明模型的行为方式,直接通过有缺陷的输入进行计算的系统会返回一个可信的数字,没有任何迹象表明有任何问题。这就提出了两个问题:当输入有缺陷时,被要求解决案例的模型是否会放弃?如果没有,当被要求验证输入时,同一模型是否可以捕获缺陷?我们研究了在缺失事实和矛盾事实扰动下由 SARA 衍生的税务案件的六个最新模型。最强大的模型在事实缺失时放弃,但通过注入矛盾进行计算,在 63-76% 的时间内返回干净的输入答案,没有冲突信号;当要求验证相同的输入时,他们标记了大部分矛盾。我们将该验证调用连接到一个简单的矛盾门:当模型报告冲突时,会放弃一个额外的调用。在所有六个模型中,它以最多约 5 个百分点的干净准确度成本恢复了大部分错过的矛盾弃权,无需训练,也无需外部工具。因此,格式正确的输入的高精度是可靠性的不完整衡量标准,并且求解器错过的检测可以通过单次自检廉价地恢复。