论文
LegalHalluLens:类型化幻觉审计与校准多智能体辩论打造可信法律AI
LegalHalluLens: Typed Hallucination Auditing and Calibrated Multi-Agent Debate for Trustworthy Legal AI
摘要
部署于法律工作流的AI系统幻觉率在聚合指标下约52%——但该平均值掩盖了错误集中在哪里、朝哪个方向偏——使合规官没有可信部署的可行动信号。我们呈现LegalHalluLens——含三组件的审计框架:跨四类法律动机声明类别(数值、时间、义务/权利、事实)的CUAD类型化幻觉画像;把遗漏vs捏造偏差约简为单一可比部署标量的风险方向指数(RDI);以及按幅度与方向校准的类型化辩论管线。在510份合同、249,252个条款级实例上——我们测得聚合报告掩盖的义务/数值类与时间类声明间约38-40pp的模型内差距——并表明两个幻觉率同为52%的系统可携带相反的RDI。辩论管线把捏造型检出削减45%——逐类增益跟踪诊断——以显著更小的骨干(4B激活参数)匹敌商用API。类型化画像与RDI浮现聚合指标隐藏的失败模式;我们进一步表明这些诊断可作为多智能体辩论管线的校准输入——针对实测失败模式的怀疑者挑战与非对称门优于泛化调优辩论。该框架支持野外部署法律AI的方向感知采购、问责与智能体设计。
