论文

通过截断解码树的确定性探索进行高效的测试时推理

Efficient Test-Time Inference via Deterministic Exploration of Truncated Decoding Trees

模型推理解码与生成控制

摘要

自一致性通过并行采样多个推理轨迹并进行投票来提高推理时间性能。然而,在数学和代码等受限领域,这种策略的计算效率很低,因为它通过替换进行采样,反复重新访问相同的高概率前缀和重复的完成。我们提出了不同叶子枚举(DLE),这是一种确定性解码方法,它将截断采样视为对修剪后的解码树的遍历,并系统地枚举不同叶子而不是替换采样。该策略通过两种方式提高推理效率。从算法上讲,它通过探索以前未访问过的高概率分支来增加固定预算下截断搜索空间的覆盖范围。从系统上来说,它重用了共享前缀并减少了冗余词元的生成。根据经验,DLE 探索比随机自洽更高质量的推理轨迹,在数学、编码和一般推理任务上产生更好的性能。