论文
ReSolve:通过选择性生成调节重用候选推理
ReSolve: Reusing Candidate Reasoning through Selective Generative Moderation
摘要
对多个解决方案进行采样将计算花费在中间推论和未完成的论证以及最终答案上。我们引入了 ReSolve,这是一种无需训练的推理程序,可通过选择性生成调节重用此候选推理。当候选人不同意或缺乏可解析的答案时,答案分配控制器调用模型来检查现有的推导,然后将生成的解决方案合并到有界循环中。在使用两个独立抽样的候选池评估 130 个竞赛数学问题的混合评分下,ReSolve 获得了 100 和 99 个正确答案,而对相同的四个候选池进行投票时分别获得了 91 和 92 个正确答案,并且相对于两个候选池中的投票没有正确到错误的变化。八样本自洽获得 94 和 96 个正确答案,同时消耗更多的 token; ReSolve 在两次评估中使用的标记分别减少了 46.3% 和 47.2%。受控消融消除了可见的推导,同时保留答案键、投票计数和每个州的产出上限规则,尽管计算量增加,但准确度从 100 正确率降低到 93 正确率。选择性审核和始终在线的统一审核都解决了 97 个问题,而选择性审核词元减少了大约 54%,总管道词元减少了 6.2%。这些结果支持候选推理作为可重用的推理计算。它们没有比额外采样具有准确性优势,也没有从专门的路线指令中获得明显的好处。