论文
受监督的昆士兰大学集成何时改进 LLM 幻觉检测?稳健性研究
When Do Supervised UQ Ensembles Improve LLM Hallucination Detection? A Robustness Study
摘要
不确定性量化 (UQ) 方法广泛用于闭门设置中 大语言模型 (LLM) 的幻觉检测,其中 真值 证据在推理时不可用。先前的工作提出通过学习的集成来组合昆士兰大学信号,但对这些集成的鲁棒性的实证研究是有限的。我们研究了一种监督集成框架,该框架在标记 LLM 响应的小型特定领域数据集上训练基于异构 UQ 的评分器输出的分类器,然后将其应用于样本外幻觉分类,而无需检索、工具或参考文档。在四个 LLM、九个数据集和三个生成机制(短格式 QA、长格式生成和代码生成)中,我们提供了沿着三个轴的系统稳健性分析:样本效率、域内数据集传输和生成机制依赖性。我们发现,在 32 个设置中的 30 个设置中,受监督集成的表现优于最佳个人评分器,并且仅从 100 个标记实例中即可实现收益。在分布转移下的域内转移情况下,集成保留了大部分优势,在 28 种转移设置中的 23 种中表现优于最佳非集成得分者。基于采样的黑盒集成几乎与完整集成一样有效,而单代白盒集成提供的好处有限。