论文
引文图覆盖率影响法律大模型幻觉测量的可靠性
Citation Grounding Measures the Oracle: Graph Coverage Determines Reported LLM Hallucination Rates in Law
摘要
从真实法院裁判中提取引文并构建图谱,可以大规模核验大语言模型生成的法律引用,无需标注员或参考答案。本文发现,该指标受所查询图谱的覆盖范围影响;当覆盖足以使核验结果可靠时,它又无法有效区分模型。 研究固定回答、提取器和指标,对四个商业大语言模型回答的 100 个乌克兰法律问题,共 400 份回答,在同一全国引文图的两个快照上评分。稀疏快照包含 47 万条记录,核验得分为 0.791—0.855,看似有 15%—21% 的引用存在幻觉;十周后重新构建的密集快照包含 3.3 亿条记录、5800 万份裁判,相同回答的得分升至 0.989—0.999。仅按记录数校准的均匀抽样模型,就能在 0.018 的误差内复现稀疏快照的得分,而不需要了解语言模型。按问题进行自助采样还发现,在所有测试的参考库规模下,均无法以 95% 置信水平区分任意一对系统。 稀疏参考库看似区分了模型,却主要反映采集覆盖差异;密集参考库的核验更可靠,却失去了模型区分度。独立法规登记库复核表明,稀疏快照标记的全部 54 条引用都指向真实条文,误报率为 100%;密集快照标记的四条引用中,两条为捏造,一条为覆盖缺口,另一条无法明确分类,可能涉及已废止规定。这说明,引用核验需要同时检查参考库的覆盖范围。