统计侦察发现辩论安全但不是辩论有用的案例:开放权重 LLM 推理协议的匹配上限研究
Statistical Scouting Finds Debate-Safe but Not Debate-Useful Cases: A Matched-Ceiling Study of Open-Weight LLM Reasoning Protocols
摘要
语言模型什么时候应该直接回答、采样和投票,或者进行多智能体辩论?最近的研究表明,投票通常可以解释辩论带来的大部分收益,而选择性辩论系统只能对不确定的例子进行审议。我们问:在生成词元的匹配上限(每个示例 960)下,每个示例存在多少路由余量,以及可以从廉价的预审议信号中恢复多少?我们使用 Llama 3.1 8B Instruct 和 Ministral 3 8B Instruct 评估了 MuSiQue 和 GSM8K 上的贪婪解码、三样本投票和两智能体批判-修改辩论。在 MuSiQue 上,每个示例选择正确协议的预言机比最佳固定协议获得 +14.0 和 +13.7 pp。最佳固定协议与模型和数据集相关:每个(模型、数据集)单元格都有不同的获胜者。这种余量很难从廉价的事前信号中恢复。投票熵阈值是唯一在两个模型上定向击败最佳固定协议的控制器(+1.3 和 +1.7 pp),尽管各个配对引导 CI 包括零。联合分析(荟萃分析 +1.6 pp,p=0.125;贝叶斯 P(均>0)=0.59)方向一致,但不显着。学习控制器(LR、GBT)的性能未超过阈值。关键发现是结构性的:投票熵预测辩论安全的地方,而不是需要辩论的地方。高熵大大减少了辩论的适得其反,但 66% 对辩论有帮助的例子 (31/47) 发生在投票一致但错误的情况下。对 Llama 的单提示自我批评调查在 127/127 一致的情况下翻转了答案,产生了零相互信息,并带有有助于辩论的标签;我们不能排除提示合规性工件,但任何一种解释都会使探测器失去作为路由器的资格。恢复剩余的净空需要行为探针来避免 8B 规模的格式合规性混淆。