论文
超越“我不知道”:评估 LLM 区分数据和模型不确定性的自我意识
Beyond "I Don't Know": Evaluating LLM Self-Awareness in Discriminating Data and Model Uncertainty
摘要
可靠的大语言模型(LLM)在信心不足时应弃权。然而,之前的研究通常将拒绝视为一般性的“我不知道”,无法区分输入级模糊性(数据不确定性)和能力限制(模型不确定性)。这种缺乏区分限制了下游行动决策,例如请求澄清或调用外部工具。在这项工作中,我们引入了 UA-Bench,这是一个基准,包含从涵盖知识密集型和推理密集型任务的六个数据集中提取的 3,500 多个问题,旨在评估显式的不确定性归因。对 18 个前沿 LLM 的评估表明,即使是最先进的模型也难以可靠地区分数据不确定性和模型不确定性,并且高答案准确性并不一定意味着强大的不确定性归因能力。为了缩小这一差距,我们提出了一种轻量级数据合成和强化学习策略,在思维模式下的 Qwen3-4B-Instruct-2507 和 Qwen3-8B 上进行的实验表明,所提出的方法在保持答案准确性的同时提高了不确定性归因。代码和数据现已公开。