论文

并非所有答案都在上下文中具有说服力:上下文影响下大语言模型中的推理动态

Not All Answers Are Contextually Persuadable: Inference Dynamics in Large Language Models under Contextual Influence

模型评测模型行为与机制分析

摘要

现代提示技术的核心是上下文敏感性,即大语言模型根据推理时上下文调整其预测的能力。尽管具有核心作用,但在强烈的语境影响下的推理行为仍然知之甚少,特别是在内部推理动态层面。我们引入了一个理论框架,用于通过推理动态分析上下文影响,从而能够对输出级别答案变化之外的推理行为进行定量表征。我们的分析表明,在重复的上下文断言下,推理动力学不会表现出无限的漂移。相反,预测表示会收敛到稳定的、依赖于查询的机制,从根本上限制上下文信号是否可以改变模型的预测。这导致了一个令人惊讶的发现:重复的上下文断言在推理过程中不会起到积累证据的作用,因此即使在无限重复的情况下也可能无法改变模型的预测,而在其他情况下预测的变化是不可避免的。我们凭经验验证了我们的理论预测,证明了理论与观察到的推理行为之间的紧密一致性。这些贡献为表征推理过程中上下文影响的限制提供了一条原则性的途径,为模型开发提供了实际意义。

并非所有答案都在上下文中具有说服力:上下文影响下大语言模型中的推理动态的原论文方法或结果图
图 4:重复引起的答案变化的案例研究和我们的预测。对于每个查询,我们在 $N{=}0$ 和 $N{=}1000$ 上显示模型的预测,以及基于表示空间分析的预测结果。复选标记表示正确的预测,说明我们的方法可以可靠地预测模型之间的重复效应。