论文
分解LLM自洽中的错误共识协议
Decomposing Wrong-Consensus Agreement in LLM Self-Consistency
摘要
语言模型的重复样本之间的一致性通常被视为答案可靠性的证据,但错误的答案可能与正确的答案一样强烈。本文询问错误共识协议实际上包含哪些信息,并通过定量分解来回答。由参考尺度 d=(1-p)/(C-1) 归一化的多元一致性指数 Gamma 被分为机械部分(仅由每个案例的答案偏好提供的一致性)和偏好无法解释的残差。机械参考是无泄漏的:每个案例的偏好和准确性仅根据其其他运行来估计。在公共 GPT-4.1 每次运行数据上,覆盖 phi(机械/经验比率)显示了与基准相关的方向:多项选择 GPQA-Diamond 上为 0.81-0.93,而开放域 AIME 上为 0.59-0.78,其中 1.54-2.80 Gamma 单位的残差幸存下来,超过了校准的运行级别偏好异质性参考所吸收的量。在一个固定协议(每个问题四次运行,K=32 票)下对五个开放权重检查点(Qwen3.5-9B/122B、Qwen3.8-27B、Gemma4-26B/31B)进行的受控复制发现所有十个单元中几乎完全机械覆盖(phi 约为 1,有一个小超调,与量化的有限供体插件偏差一致),对两次运行设计具有鲁棒性;最大的单元格(qwen3.5-122b,p=0.222)位于 GPT-4.1 AIME 精度范围内,并且仍然饱和(phi=1.041)。在可比较的总精度下进行跨系统对比,将开放权重模型中几乎完全的机械一致性与前沿系列中较大的偏好无法解释的残差进行对比。这种对比与设计的采样协议相混淆。协议是分级证据,而不是证明。没有提出新的投票方式;代码和证据均已提交。