论文

从信号到传输:大语言模型 中基于探针的不确定性估计的分解研究

From Signals to Transfer: A Factorised Study of Probe-Based Uncertainty Estimation in Large Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

基于探针的不确定性估计 (UE) 已成为通过从内部模型信号中学习不确定性来检测 大语言模型 (LLM) 中幻觉的重要方法。然而,最近的方法在特征设计、训练数据构建和评估设置方面同时变化,掩盖了真正驱动性能的因素。为了解决这个问题,我们提出了在匹配条件下基于探针的 UE 的分解研究。我们的结果表明,原始隐藏状态和注意力特征很难超越域内。然而,在分布变化下,结构化和压缩的特征更加稳健,这表明仅凭领域内的性能不足以衡量进展。此外,提示和标签构建显着影响探针行为。基于这些最佳实践结果,我们训练基于基准的预训练探针,这些探针可以很好地转移到开放式事实生成,从而提供稳定的现成基线。我们的工作鼓励对基于探测的不确定性估计器进行更多面向部署的评估。代码存储库位于 https://github.com/ponhvoan/ProbeUE。