论文

稳定的答案,未完成的推理:为什么自我共识不是安全的提前退出信号

Stable Answers, Unfinished Reasoning: Why Self-Consensus Is Not a Safe Early-Exit Signal

模型评测模型行为与机制分析

摘要

降低推理模型推理成本的一种自然方法是重复探测当前答案的单个部分轨迹,并在探测达成一致(自我共识)后停止。我们询问这样的规则是否既安全又节省词元,以及是否可以选择一次并重复使用。预先注册的 3,520 条共识规则的扫描,在两个模型和三个基准的冻结轨迹上重播,没有清除预先确定的三个接受门;边界在保留的分裂和两个看不见的模型上重现——而边界置信控制(DEER)扫过同一管道清除了所有三个模型。原因在于信号:协议确定当前答案在固定的探测程序下持续存在,而不是推理已经终止——共识终止间隙。停止它会提交非最终答案。按照仍节省 32% 词元的规则,九分之一的停靠点会触发轨迹本身后来放弃的答案,并且大多数停靠点都会切断本来会做出的修正。扩大协议窗口并不能消除它们:份额稳定在 7% 附近,而到那时节省已降至 8%。探针的重新措辞和手工标记的错误分类显示,商定的答案通常是模型尚未确定的占位符。单独用作停止信号时,协议失败并不是因为它不够严格,而是因为它重复测量了错误的对象。