论文

语言模型何时应该信任自己?作为条件置信信号的同模型自我验证

When Should a Language Model Trust Itself? Same-Model Self-Verification as a Conditional Confidence Signal

模型评测鲁棒性、公平性与可信度评测

摘要

同一模型的自我验证促使模型审核自己的预测答案,这是选择性预测的一个看似合理的置信信号,但一旦认真对待基于可能性的基线,其实际价值仍不清楚。我们在 ARC-Challenge 和 TruthfulQA-MC 上跨多个模型系列、尺度和提示变体,根据两个这样的基线(LL-AVG 和 LL-SUM)评估自我验证。我们不仅衡量正确性排名,还通过 AURC 和操作点分析衡量弃权质量。结果明显依赖于任务和模型。在 ARC-Challenge 中,Phi-2 和 Qwen 模型的自我验证能力比 LL-AVG 有了显着提高,其中 Qwen-7B 的进步最大。然而,在 TruthfulQA-MC 上,信号不太可靠:较小的模型可能变得对提示敏感,DeepSeek-R1-Distill-8B 相对于 LL-AVG 性能下降,而 LL-SUM 通常仍然是更强的实用基线。因此,我们不将自我验证视为通用的不确定性估计器。在这种情况下,它可以更好地理解为一个条件置信信号,其值取决于任务类型、模型系列、提示制定,以及最重要的是它必须超越的基线。