论文
快速分叉:有效估计文本生成中的不确定性动态
Forking Fast: Efficiently Estimating Uncertainty Dynamics in Text Generation
摘要
LLM 推理是随机的,因此理解模型需要解决它可能针对给定问题产生的推理链的分布,即其不确定性。基于重采样的分析描述了这种分布的特征,揭示了采样轨迹的哪些步骤决定了模型如何得出答案。然而,这些方法的一个主要限制是,在推理链中的每个标记或句子处重新采样文本序列的成本非常高。我们的工作致力于提高重采样分析的计算效率,同时也揭示了一个重要的科学问题:解释文本生成中的不确定性动态的正确统计模型是什么?我们表明,当对许多推理链进行重新采样时,不确定性动态会收敛到稳定模式,并且噪声很大程度上是采样的产物,而不是 LLM 对每个单独标记或推理步骤的敏感性。我们开发了一个统计模型,用于平滑嘈杂的低样本采样轨迹数据,以更好地近似高样本数据,从而使我们能够显着降低采样成本。