论文
当验证器在判决替换下投出反向票:相关自一致性中的有符号关键票价值
When Verifiers Vote Backwards under Verdict Substitution: Signed Pivotal Value in Correlated Self-Consistency
摘要
替换一张选票只能改变那些仅由单票之差决定的查询上的多数决策;这一结构性事实不需要任何独立性假设。我们用带标签的判决式干预研究这一变化的符号:在k=7的自一致性面板中,用一个正确性信号替换一张正确性指示选票。这一诊断性干预不等同于实际部署的按答案身份计数的多数投票。MATH-500主实验(n=570)给异构模型验证器带来+24.2个百分点的关键票增益,而角色互换配置则为-11.2个百分点;一项探索性代码压力测试(9个任务中14个关键行)为-24.5个百分点。精确的有符号增益分解表明,所有观测到的符号都可由验证器在特定状态下的准确率与两个单票计票状态的组合来解释,而非由全局准确率或模型来源解释。同源信号在关键层上损失准确率(主配置中从65%降至44%),而误差相关性提供了一种描述性的误差关联诊断。受控退化实验与k∈{3,5,7}子集敏感性分析检验了观测模式在该核算体系周围的稳定性。在所评估的“平局记错”答案身份多数投票分析下,结构性零与强验证器收益持续存在,但角色互换的危害减弱至-0.9个百分点且不显著。因此,结果确立的是有害的判决替换,而非普遍有害的已部署多数投票,并激发了一个可检验但未经证实的负过程奖励模型权重假设。
