论文
选择性再生解码:面向推理时推理过程的轨迹级干预
Selective Regenerative Decoding: Trajectory-Level Intervention for Inference-Time Reasoning
摘要
推理时解码方法通过探索多条候选轨迹来提升LLM推理能力,但把每条轨迹当作原子整体:要么整个保留,要么不可逆地丢弃。这对部分有前景的候选造成计算浪费——其高质量前缀与退化的后缀一起被抛弃。我们提出选择性再生解码(SRD),将每个候选路由到丢弃、保留或仅再生后缀中退化部分,同时保留边缘候选的有用前缀,且不需要更大的目标模型。在温和假设下,SRD相对拒绝采样取得1.28至1.36倍的样本效率提升,期望轨迹质量严格更高,且增益随候选池增大而增长。在MATH500、GPQA Diamond、HotpotQA和AlpacaEval上,配合多组生成-奖励模型对,SRD以显著更少的生成token达到Best-of-N的准确率,并在低算力情形下优于推测拒绝(speculative rejection)。通过实现片段级干预而非整轨迹选择,SRD为推理时解码开辟了准确率-算力权衡中此前未被充分探索的区域。