论文
可检测性差距:跨语言模型的幻觉检测中隐藏的异质性
The Detectability Gap: Hidden Heterogeneity in Hallucination Detection Across Language Models
摘要
基于采样的一致性广泛用于幻觉检测,但总体性能可以隐藏可检测错误的系统差异。这项工作研究了四种语言模型和三个事实问答数据集的异质性。按答案一致性划分幻觉揭示了高一致性(幽灵)和低一致性(闪烁)状态,其明显的可检测性差距为 0.35 美元至 0.46 美元 AUC。由于用于定义制度和衡量这种差距的统计数据是强耦合的($|ρ|\approx0.94$ 到 $1.00$),因此原始结果被视为基于协议的检测的属性,而不是独立证据。冻结机制分配后,词汇和语义响应分散保留了不对称性,引导 $95\%$ 间隔在所有 $12$ 模型和数据集设置中排除零。使用个体扩散轨迹且无交叉种子信息的更严格测试保留了所有三个 LLaDA 数据集 ($p<0.005$) 和所有三个 Dream 数据集的定向不对称性,其中一个达到了显着性。不同模型之间的硬机制的流行程度差异很大($16\%$ 到 $77\%$),并且匹配的提示经常会在模型之间改变机制。这些发现表明,聚合检测指标掩盖了语言模型失败中持久的、模型依赖的异质性,并激发了制度条件评估。