论文
I-CALM:激励 LLM 选择性回答的信心意识弃权
I-CALM: Incentivizing Confidence-Aware Abstention for LLM Selective Answering
摘要
大语言模型 (LLM) 通常会产生自信但不正确的答案,部分原因是标准评估激励奖励猜测而不是表达不确定性。我们研究具有可验证答案的事实问题的认知弃权,其目标是提高选择性回答,使 LLM 在可能错误时弃权,同时保留正确答案。受人类在问答中行为决策的启发,我们引入了 I-CALM,一个黑盒 LLM 的提示级框架。 I-CALM 结合了引发的口头信心、宣布的答案/弃权回报以及强调真实、谦逊、证据支持和责任的规范指导。为了区分有针对性的弃权和不加区别的拒绝,我们使用了两阶段评估协议,其中LLM首先选择是否回答或弃权,然后被迫为弃权者提供最佳猜测。在模型和事实 QA 数据集中,I-CALM 通过降低浮现答案中的错误答案率并提高弃权质量、将容易出错的情况转变为弃权,同时保留模型本应正确回答的答案,从而提高选择性回答。总体而言,I-CALM 提供了一种轻量级的方法来改进推理时间选择性回答,而无需重新训练或访问模型的内部状态。代码可在 https://github.com/FayLONG03/hallucinationControl 获取。