论文
测试时数学推理中的预算边界效应
Budget Boundary Effects in Test-Time Mathematical Reasoning
摘要
累积词元上限可能属于数学推导范围,迫使测试时间控制器在停止上限(严格)和允许当前尝试完成(建议)之间进行选择。我们通过 19,200 个公共轨迹的配对离线重放来衡量这一边界选择:120 个 AIME、BrUMO 和 HMMT 问题以及一个模型的两个存档配置。候选顺序和 16 次尝试的上限是固定的,答案选择对参考答案和正确性标签是盲目的。出现了三个发现。首先,在 4k 上限下,大多数建议准确性的提高都会用正确答案取代弃权;严格停止会支付仅完成选择器无法使用的未完成前缀。其次,已实现成本的比较与同上限比较不同:在可比较的平均完成成本下,低级别咨询 4k 的准确度高于严格 8k,而在高级别,使用其平均词元的 59% 时,其观察到的准确度比严格 32k 低 0.42 个点。这些总体比较并未建立同等计算优势或准确性等效性。第三,增加候选覆盖率并不能保证更高的答案准确性:当覆盖率增加时,对数概率选择器会失去准确性,包括在源级一致性修复之后。相同上限多数准确率差异缩小至 32k,低于 1.3 个百分点。预算曲线应共同说明上限、实现成本、合格候选人、停止规则和选择者信息。