论文
你为什么不知道?评估不确定性源对 LLM 中不确定性量化的影响
Why Don't You Know? Evaluating the Impact of Uncertainty Sources on Uncertainty Quantification in LLMs
摘要
随着 大语言模型 (LLM) 越来越多地部署在现实世界的应用中,可靠的不确定性量化 (UQ) 对于安全有效的使用变得至关重要。大多数现有的昆士兰大学语言模型方法旨在产生单一置信度分数——例如,估计模型答案正确的概率。然而,自然语言任务的不确定性来自多个不同的来源,包括模型知识差距、输出可变性和输入模糊性,这些对系统行为和用户交互有不同的影响。在这项工作中,我们研究不确定性来源如何影响现有昆士兰大学方法的行为和有效性。为了实现受控分析,我们引入了一个新的数据集,该数据集对不确定性源进行明确分类,从而可以对每种条件下的昆士兰大学表现进行系统评估。我们的实验表明,虽然当不确定性仅源于模型知识限制时,许多昆士兰大学方法表现良好,但当引入其他来源时,它们的性能会下降或变得具有误导性。这些发现强调需要明确解释 大语言模型 中不确定性来源的不确定性感知方法。