论文

LLM 作为隐式输入者:不确定性应该随着信息缺失而扩展

LLMs as Implicit Imputers: Uncertainty Should Scale with Missing Information

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 越来越多地部署在可用上下文不完整或降级的环境中。我们认为,在不完整上下文下生成答案的 LLM 可以被视为隐式插补器,并根据多重插补 (MI) 文献中的标准进行评估:不确定性应随着缺失信息的数量而缩放。我们使用受控框架在 SQuAD 上评估这一标准,其中上下文可用性在五个级别上有所不同。我们评估可以通过重复采样估计的两个答案级别的不确定性度量:基于采样的置信度(经验模式频率)和响应熵。信心并不能反映出缺失的增加:即使准确性下降,信心仍然很高。相比之下,熵随着上下文的移除而增加,这与 MI 的类比一致,并且解释了所有证据水平上的准确性差异比置信度大得多的差异(二次 $R^2$ 差距高达 0.057)。我们进一步引入了一个黑盒诊断$ρ_R(α)$,它估计由上下文水平$α$解决的基线不确定性的比例,只需要在有或没有上下文的情况下重复采样。这些结果表明,在不完整的背景下,熵是一种比置信度更敏感的黑盒不确定性度量。