论文
校准标签稀缺情况下 LLM 和 VLM 幻觉检测的密度岭选择性预测
Density Ridge Selective Prediction for LLM and VLM Hallucination Detection under Calibration Label Scarcity
摘要
大型语言和视觉语言模型中的幻觉检测越来越多地被视为选择性预测,其中检测器分配置信度分数并在置信度较低时放弃。无监督采样检测器(语义熵)避免了标签,但质量稳定,而有监督探针获得了更强的分布内分数,但当校准标签稀缺时,分数急剧下降。我们将 LLM 的响应流形恢复为基于隐藏状态生成轨迹的六维运动学特征图构建的核密度估计的密度岭。测试生成通过从其投影特征点到最近的脊顶点的负欧几里得距离进行评分,产生随机输出分布的低维几何骨架。我们在故意标签稀缺的协议中使用八个文本和视觉 LLM($n_{\text{cal}}{=}200$ 查询,$N{=}5$ 代),在六个 QA 基准(HaluEval-QA、TriviaQA、GSM8K、POPE、ScienceQA、A-OKVQA)上对语义熵、拓扑方法和对数概率进行评估。我们基于岭的分数以 5-20 分的增益击败了 AUROC,同时展示了校准标签稀缺情况下的缓和退化。