论文

HalluTracer:通过深度平均探针进行预解码真实性预测-logits

HalluTracer: Pre-Decoding Truthfulness Prediction via Depth-Averaged Probe-Logit

模型评测评测方法与指标

摘要

在 大语言模型 生成答案之前,内部状态探测可以实现真实性预测。当检测器改变它们读取的层以及用于组合它们的规则时,改进预测的来源变得难以识别。我们将这些选择分开,发现即使在固定的相等权重下,保留更多层也可以改善预测。精确的费希尔比分解解释了为什么线性重新加权的额外好处在这些探测分数上受到限制:层内差异的信息很大程度上与深度均值捕获的信息重叠。当用于拟合它们的数据有限时,估计额外的权重可以抵消这个小小的好处。这些发现激发了我们提出的方法 HalluTracer,该方法对分层探针 logits 进行平均,以在解码之前预测真实性。在包括 TruthfulQA 在内的 6 个模型和 4 个基准中,HalluTracer 在比较方法中的 24 个模型基准对中的 23 个中实现了最高的受试者工作特征曲线下面积 (AUROC)。结果支持使用来自整个网络的证据,而不需要相应更灵活的聚合规则,阐明了层选择和加权在预解码检测中的不同作用。