论文
LLM 弃权的两个轴:答案正确性和问题可答性
Two Axes of LLM Abstention: Answer Correctness and Question Answerability
摘要
模型应该拒绝两种不同的事情:它会出错的答案,以及它根本不应该回答的问题,例如无法回答的问题或基于错误前提的问题。通常的方法会设定一个置信度阈值,无法区分它们。在来自三个系列(2B 到 14B)的五个指令调整模型中,我们发现它们是独立的轴。普通的答案置信度追踪答案是否正确,但对问题是否可回答几乎视而不见。隐藏状态上的线性探测则相反。盲点不会随着规模的扩大而缩小。对于自然发生的假前提问题 (CREPE),情况最糟糕。在那里,答案置信度、P(IK)、P(True),甚至直接询问模型前提是否为假,都接近机会,而隐藏状态探测达到 0.69 到 0.77 AUROC:模型代表了一个它不会报告的问题。事实证明这是可以修复的。指示模型检查前提会适得其反,因为它随后会同样质疑合理前提和错误前提(57%的错误挑战),无法区分它们;使用探针路由相同的指令大约使挑战精度提高三倍。我们将这两个轴变成一个校准策略,仅当回答性得分和正确性得分均明确时才进行回答,并分别证明其行为不同:无法回答的答案率在每个范围内都是可控的,而错误答案率则受到模型准确性的限制,因此随着阈值策略将两个预算的正确答案覆盖率认证为 0.75,而单个阈值的覆盖率为 0.31,保证会收紧;在 14B,这是唯一经过认证的保单。