论文
基于 RAG 的 LLM 共形事实性是否稳健?新指标与系统性洞见
Is Conformal Factuality for RAG-based LLMs Robust? Novel Metrics and Systematic Insights
摘要
大语言模型(LLM)经常产生幻觉,限制了其在知识密集型应用中的可靠性。检索增强生成(RAG)与共形事实性(conformal factuality)已成为应对这一局限的潜在途径。虽然 RAG 旨在让回复立足于检索到的证据,但它对最终输出的正确性不提供任何统计保证。共形事实性过滤通过在留存数据上校准的阈值对原子化声明进行评分与过滤,提供无分布假设的统计可靠性,但最终输出的信息量并无保证。我们从生成、评分、校准、鲁棒性与效率等方面系统分析共形事实性在基于 RAG 的 LLM 上的可靠性与有用性。我们提出新的信息量感知指标,以更好地反映共形过滤下的任务效用。在三个基准与多个模型家族上,我们发现:(i)共形过滤在高事实性水平下因输出空洞而有用性低下;(ii)共形事实性保证对分布漂移与干扰项不稳健,凸显了校准数据必须与部署条件紧密匹配的局限;(iii)轻量级基于蕴含的验证器可与基于 LLM 的模型置信度评分器持平或更优,而所需 FLOPs 减少 100 倍以上。总体而言,我们的结果揭示了事实性与信息量之间的权衡,以及共形过滤框架在分布漂移与干扰项下的脆弱性,凸显了以鲁棒性与有用性为关键指标的可靠性新方法的必要性,并为构建既可靠又计算高效的 RAG 流水线提供了可操作的指导。
