论文
使用 大语言模型 进行可靠决策的声明级置信度校准
Claim-Level Confidence Calibration for Reliable Decision Making with Large Language Models
摘要
大语言模型 (LLM) 越来越多地支持高风险领域的决策,但他们经常产生幻觉并表达与事实正确性不一致的信心。响应级别置信度是一个粗略信号:一代人可以混合正确和不正确的陈述,因此对于必须接受、拒绝或验证个别信息的用户来说,单个数字是不可操作的。我们将声明级置信度校准研究为与决策相关的不确定性信号:每个响应都被分解为原子的、可验证的声明,并且使用来自样本一致性和自我验证的推断时间信号为每个声明分配一个校准置信度。我们的框架在封闭环境中运行(没有 logits,没有 微调),并直接在索赔级别应用事后校准,从而实现选择性干预,例如对低置信度索赔的证据检索或人工审查。在 TriviaQA 和 TruthfulQA 中,我们评估了 6 个最新模型(Llama-3.1、Mistral、Qwen2.5、DeepSeek-R1、GPT-4、GPT-4o)的 7 个基线,并表明,声明级分解与事后校准相结合,减少了事实问题的预期校准误差,同时暴露了决策者最需要可靠的不确定性估计的对抗性虚假前提问题的故障模式。