论文

推理中的跨LLM一致性:来自共享交互的证据

Cross-LLM Consistency in Inference: Evidence from Shared Interactions

模型评测模型行为与机制分析

摘要

大型语言模型 (LLM) 在架构、训练数据和优化过程方面有所不同,但它们仍然可能开发出类似的内部推理模式。在本文中,我们使用基于交互的解释来检验这一假设。我们发现,大语言模型在从相同的提示中预测相同的目标标记时经常共享交互模式。这种一致性在高级大语言模型中更为明显。共享交互也往往是低阶的,并且比非共享交互表现出更弱的正负抵消。这些结果表明,即使产生这种跨模型一致性的机制仍然开放,高级大语言模型可能会隐式针对常见推理模式进行优化。

推理中的跨LLM一致性:来自共享交互的证据:论文配图
图 1:基于交互的解释。 (a,b) 目标标记 v⁡(𝐱)v(\mathbf{x}) 的预测分数可以通过由稀疏交互组成的逻辑模型 phi\phi 来近似。逻辑模型在所有 2n2^{n} 个屏蔽输入状态上忠实地匹配 LLM 输出。 (c) 只有非常稀疏的相互作用才表现出显着的相互作用效应。所有其他交互作用几乎都是 00 效果。 (d) 给定一对大语言模型,我们发现这两个大语言模型通常共享一组相似的推理交互。非共享交互通常表示由单个 LLM 编码的过度拟合模式。