论文

从漂移到连贯:稳定 LLM 的信念

From Drift to Coherence: Stabilizing Beliefs in LLMs

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 通常被假设为执行隐式贝叶斯推理,但关键的连贯性条件(预测信念的鞅属性)已被证明在受控综合上下文学习环境中失败。我们以更典型的使用方式重新审视这个问题:通用多项选择题回答。利用离散答案空间,我们计算精确的预测分布并研究自回归答案重采样引起的信念动态。我们引入提示预测重采样 (PPR),其中 LLM 生成同一问题的一系列答案。根据经验,PPR 揭示了早期信念漂移,表明鞅违规。然而,经过足够的重采样步骤后,置信过程会自我稳定并收敛到一致的预测分布。基于这一观察,我们进一步提出(i)一种种子答案提示策略来加速稳定,以及(ii)一种自我一致性损失,通过 微调 将早期漂移摊销到模型中。多项选择 QA 基准的实验表明,我们的方法在不牺牲准确性的情况下大大减少了信念漂移并提高了预测一致性。