论文

验证脉冲和避免错误共识的成本

Verification Pulses and the Cost of Escaping Wrong Consensus

模型评测模型行为与机制分析

摘要

外部验证可以纠正个人的输出,同时使自我强化的群体陷入错误共识的盆地。我们研究固定验证预算的时序和寻址如何影响异步二进制寄存器中的恢复。对于一般的非线性响应,我们推导出在峰值验证约束下穿过盆地边界所需的最小燃料。对于有限的群体,精确的出生-死亡计算给出了脉冲后随后出现错误共识的概率。我们的主要渐近结果确定了关键预算窗口:主导项 $N\log(x_0/b)$ 和阶数校正 $\sqrt N$,具有来自重复验证目标的单独方差贡献和验证停止后的自主放大。区别是巨大的:有 16 个多数更新槽和 14 个最初错误的槽,9 次随机检查跨越了平均场预算阈值,而在精确模型中需要 23 次才能实现 95% 的最终恢复。一项前瞻性指定的实验记录了 13,392 个语言模型响应,包括校准和 108 个保留轨迹。校准产生不同的拟合响应方案,但所有四个调整的时间表比较间隔都包括零。分布式审计还发现,适度的平均预测误差可能掩盖对终端共识占用率的大幅低估。结果支持在指定的更新合同下进行风险校准的重置调度,同时明确地将其与不同目标检查和不受限制的证据广播分开。