论文
使用 QQ 等式审核 大语言模型 中的问题顺序效应:机制表征和饱和警告
Auditing Question-Order Effects in Large Language Models with the QQ Equality: Mechanism Characterization and a Saturation Caveat
摘要
据报道,人类调查数据中的问题顺序效应大致满足 QQ(量子问题)等式,这是标准投影量子问题顺序模型的无参数预测。我们将这种等式开发成一个审计框架,用于自回归 大语言模型 (LLM) 的顺序二元判断。理论上,我们描述了稳健地满足 QQ 的机制族,证明经典重复可以精确地再现等式,并通过 $|q_{QQ}| 将 QQ 与默认的 2 级上下文标准结合起来。 \le\mathrm{OSS}$。这将顺序敏感性、QQ 不平衡和剩余上下文分开,而不是将它们视为可互换的签名。在方法上,我们引入了一种承诺的多轮强制分支协议,该协议在平衡标签映射和预先指定的健康门下从下一个词元对数概率重建顺序条件联合分布。开放权重指令调整模型上的第一个信号试点揭示了中心测量问题。尽管所有预先指定的健康门都通过了,但在直接评估框架下,18 个项目对中的 17 个和在角色框架下的 8 个项目对中,有 7 个的二元条件分布几乎是确定性的。标签分配实质上改变了几个特定于映射的 QQ 判决,并且没有项目被认证为残留上下文。因此,在测试条件下,观察到的 QQ 结果并不能唯一地识别存在饱和且标签敏感的测量界面时的响应机制。主要含义是方法论上的:在没有首先建立足够的离散度的情况下,不应将下一个标记概率解释为调查-响应分布。因此,我们认为,在 LLM 判决的分布级审计中,饱和筛选和标签平衡应先于结构解释。