论文

当自洽性适得其反:多数投票损害小模型在多数困难科学问题上的表现

When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs

模型评测模型行为与机制分析

摘要

对于小型指令微调模型,通过多数投票实现的自洽性降低了GPQA Diamond上大多数问题的单题准确率:Qwen2.5-7B有56.6%的问题、Llama-3-8B有65.7%的问题因此下降。显而易见的补救是无验证器的置信度门控。本版本报告最自然的修复同样失败,并将v1视为一体的三种信号失效区分开来。token熵门控因测量原因而失败:对约602 token的链取平均后,该统计量测量的是行文而非对答案的置信度。在Qwen2.5-7B-Instruct-Turbo上、198个问题各64个样本中,答案与其自身问题多数答案相矛盾的样本仍以20.52 nats的中位边际发出该答案,75.7%的样本高于10 nats。这两个量均经预注册,且在69个未经任何探索性分析的问题上只测试一次;均通过。汇总单位是整个结果:跨基准汇总时,该边际在“高于10 nats的比例”上将正确与错误样本区分+0.0604 [+0.0183, +0.1017],排除零;但按题、配对分析时不成立,为-0.0168 [-0.0527, +0.0182],跨越零。我们的主张并非token对数概率不携带信息,而是具有真实跨题区分力的信号,对路由器面临的题内决策几乎无用。多数一致性门控的失败仍缺乏机制解释,我们将其作为开放问题报告。这些新结论仅基于一个模型:预注册的第二个模型复现已抽样但无法评估,我们报告的是该拒绝而非结果。我们还单独报告:在小预算的托管无服务器推理上,三个推理原生模型因三个分别测量的原因而无法评估;三者皆可下载,因此这界定的是按token计费API的所购所得,而非可知范围。

当自洽性适得其反:多数投票损害小模型在多数困难科学问题上的表现:论文配图
图1:每个问题的 mv_gain=MV_acc​(64)−MV_acc​(1)\text{mv\_gain}=\text{MV\_acc}(64)-\text{MV\_acc}(1)。深色柱表示反噬(mv_gain<0\text{mv\_gain}<0)。