论文

情境参数冲突的三种机制:预测框架和实证验证

Three Regimes of Context-Parametric Conflict: A Predictive Framework and Empirical Validation

模型评测模型行为与机制分析

摘要

关于 大语言模型 如何处理训练知识与相互矛盾的文档之间的冲突的文献呈现出持续存在的经验矛盾:一些研究发现模型顽固地保留其训练过的答案,忽略了近一半的时间提供的文档,而其他研究则发现模型很容易遵循文档,大约 96% 的时间遵循上下文。我们认为,一旦人们认识到先前的实验已经研究了三种性质不同的处理情况,但没有区分它们,这些矛盾就会消失。我们提出了一个三机制框架:机制1(单源更新,主导预测因子:证据一致性),机制2(竞争整合,主导预测因子:参数确定性)和机制3(任务适当选择,主导预测因子:任务知识要求)。我们形式化了参数强度(曝光频率)和参数唯一性(编码一致性)之间的区别,凭经验表明这些是正交维度(r = -0.002,p = .97),强度作为稳定事实域中的有效预测因子。我们在三个实验阶段使用 9,970 个 API 调用,在 Claude Sonnet 4.6、GPT-5.5、Gemini 2.5 Flash、Llama 4 Maverick 和 DeepSeek V3 上验证了该框架。 GEE 逻辑回归证实了所有五个模型的预测制度 2 确定性梯度(beta = -0.38 至 -0.50,所有 p <= .013,BH-FDR 已校正)。方案 3 消融显示,单独的任务框架将上下文跟踪从近 100%(上下文知识条件)翻转到 6-71%(参数知识条件),所有五个模型均显着 (p < .001)。确定性梯度对于多项结果模型、对冲响应的敏感性分析和 FDR 校正具有稳健性。