论文

LegalHalluLens:类型化幻觉审计与校准多智能体辩论打造可信法律AI

LegalHalluLens: Typed Hallucination Auditing and Calibrated Multi-Agent Debate for Trustworthy Legal AI

模型评测评测方法与指标

摘要

部署于法律工作流的AI系统幻觉率在聚合指标下约52%——但该平均值掩盖了错误集中在哪里、朝哪个方向偏——使合规官没有可信部署的可行动信号。我们呈现LegalHalluLens——含三组件的审计框架:跨四类法律动机声明类别(数值、时间、义务/权利、事实)的CUAD类型化幻觉画像;把遗漏vs捏造偏差约简为单一可比部署标量的风险方向指数(RDI);以及按幅度与方向校准的类型化辩论管线。在510份合同、249,252个条款级实例上——我们测得聚合报告掩盖的义务/数值类与时间类声明间约38-40pp的模型内差距——并表明两个幻觉率同为52%的系统可携带相反的RDI。辩论管线把捏造型检出削减45%——逐类增益跟踪诊断——以显著更小的骨干(4B激活参数)匹敌商用API。类型化画像与RDI浮现聚合指标隐藏的失败模式;我们进一步表明这些诊断可作为多智能体辩论管线的校准输入——针对实测失败模式的怀疑者挑战与非对称门优于泛化调优辩论。该框架支持野外部署法律AI的方向感知采购、问责与智能体设计。

LegalHalluLens:类型化幻觉审计与校准多智能体辩论打造可信法律AI:论文配图
图 4:实验 2 中的每种类型增量。收益集中于义务 (Δ\DeltaFAR =−8.2=-8.2、Δ​HalGen\Delta\mathrm{Hal_{Gen}} =−6.3=-6.3) 和事实 (Δ\DeltaFAR =−5.8=-5.8)。时间 HalGen\mathrm{Hal_{Gen}} 本质上没有变化 (+0.6+0.6 pp),与基线时时间最低幻觉类型一致。校准干预产生实验 1 预测的每种类型模式。图例中的 Δ\DeltaHal 表示 Δ​HalGen\Delta\mathrm{Hal_{Gen}} 图 5:应用类型化辩论管道后 gemma-4-26B-A4B 的 RDI 变化。债务类别显示出最大的修正(−0.078→−0.014-0.078\to-0.014,接近平衡)。怀疑论挑战针对缺失条件和例外情况,解决实验 1 确定为主要义务错误方向的遗漏偏差。