论文

可靠性设计:量化并消除LLM的编造风险。从生成式到咨询式AI:法律领域的比较分析及对高风险知识库的启示

Reliability by design: quantifying and eliminating fabrication risk in LLMs. From generative to consultative AI: a comparative analysis in the legal domain and lessons for high-stakes knowledge bases

模型评测评测方法与指标

摘要

本文研究如何通过减少幻觉使大语言模型在高风险法律工作中可靠。它区分三种 AI 范式:(1) 独立生成模型(创意神谕),(2) 基础检索增强系统(专家档案员),(3) 先进的端到端优化 RAG 系统(严谨档案员)。作者引入两个可靠性指标——虚假引用率(FCR)与编造事实率(FFR)——并通过专家双盲评审评估来自 12 个 LLM、覆盖 75 个法律任务的 2,700 个司法风格回答。结果显示,独立模型不适合专业使用(FCR 超过 30%),基础 RAG 大幅减少错误但仍有明显失锚,先进 RAG 采用嵌入微调、重排序与自我纠错等技术,把编造降到可忽略水平(低于 0.2%)。研究结论是:可信法律 AI 需要以严谨为中心、强调验证与可追溯的检索式架构,并提供了适用于其他高风险领域的评估框架。