论文
再想想还是想久点?预算感知推理的选择性验证
Think Again or Think Longer? Selective Verification for Budget-Aware Reasoning
摘要
测试时推理日益被用作服务时控制旋钮——但额外推理并非均匀有价值:它可能修复失败的尝试、在已正确的答案上浪费算力——或引入有害的答案改变。我们把它研究为部署分配问题而非新验证器问题。我们介绍SeVRA——面向推理分配的选择性验证——服务层控制器——决定是保留冻结求解器的初始答案还是调用主动验证。使用冻结的Qwen3-4B求解器——我们记录干预结果——从服务可见的尝试状态训练可恢复性感知门。在MATH上——选择性验证达76.3%准确率——对照总是验证的75.5%——同时后生成token减少26.8%、有害翻转从2.2%降到1.0%。但8,192 token的初始求解以少28%的总模型token达到76.0%准确率——表明选择性恢复有用——但不是受测的最佳成本前沿。在冻结迁移到GSM上——选择性策略仅验证3.0%的示例——把准确率从93.4%提到94.5%——相对总是验证减少91.2%的验证token;同样——更长的初始求解以更少已实现token匹敌其准确率。在CommonsenseQA上——常开验证有害——而Self-Consistency@5以约五倍已实现token成本提升准确率。由此得出部署规则:先调初始预算——再在显式检查、有界重试、可审计性或回归风险控制要紧时使用选择性恢复。
