论文
从 大语言模型 中的顺序内部色散学习不确定性
Learning Uncertainty from Sequential Internal Dispersion in Large Language Models
摘要
不确定性估计是检测 大语言模型 (LLM) 中幻觉的一种有前途的方法。最近的方法通常依赖于模型内部状态来估计不确定性。然而,它们受到关于隐藏状态应如何跨层演化的严格假设的影响,并且由于仅关注最后一个或平均标记而导致信息丢失。为了解决这些问题,我们提出了顺序内部方差表示(SIVR),这是一种有监督的幻觉检测框架,它利用从隐藏状态派生的逐标记、逐层特征。 SIVR采用了一个更基本的假设,即不确定性表现在跨层内部表示的分散或方差程度,而不是依赖于特定的假设,这使得方法模型和任务不可知。它还聚合了每个标记方差特征的完整序列,学习指示事实错误的时间模式,从而防止信息丢失。实验结果表明 SIVR 始终优于强基线。最重要的是,SIVR具有更强的泛化性,避免依赖大型训练集,凸显了实际部署的潜力。我们的代码存储库可在线访问 https://github.com/ponhvoan/internal-variance。