重新采样还是重新路由?无需确定行动选择即可收回的停止债务
Resample or Reroute? Recoverable Stopping Debt Without Identified Action Selection
摘要
在弱验证者接受大语言模型响应后,第二次调用可能会重新采样或重新路由。由于正确性是隐藏的,所以动作选择是一个识别问题。我们订购了三个门:可收回的停止债务、双边 FIT 行动支持以及结果盲目选择者的保留价值。在固定的 152 个查询 MBPP+ 实验中,仅 Qwen2.5-14B Base 假阳性停止使 Qwen2.5-7B 恢复率增加 2.592 个百分点(查询集群 95% 区间 [+1.618,+3.664])。另外,在 7B 基础测试拒绝后,固定升级到 14B 超过留一 7B 重采样 +2.882 点 [+0.931,+5.201];这是固定动作排名,而不是条件选择。全集审计产生 +2.697 点的已实现最大差距,但对于两个行动,该统计数据等于 (1/2)E|Delta| - (1/2)|E 三角洲|并且不包含可观察的历史术语。它位于精确倍数可交换参考内(平均值 +3.158;95% 区间 [+2.434,+3.947])。审计无条件对 1,520 个事件进行操作:1,240 个可观察的停止和 280 个验证者拒绝; 198 次停止是仅评估器误报。测试的结果盲控制器都没有改进固定重新路由。尽管有独家的 TEST 救援,但单独的 LiveCodeBench 梯子仍具有全零 FIT 操作优势。然后,预先注册的 BigCodeBench 支持门仅发现 23/19 和 22/19 签名的剧集/查询,而最小值为 25/20,因此 L1-L4、DEV 和 TEST 保持未打开状态。停止债务是存在的,但目前的证据并没有确定何时重新抽样而不是重新安排。