论文

FutureBridge:协作解码中超越本地偏好的词元选择

FutureBridge: Token Selection Beyond Local Preference in Collaborative Decoding

模型推理解码与生成控制

摘要

词元级 协作允许 大语言模型 (LLM) 在预测出现分歧时协助小型语言模型 (SLM)。现有方法要么使用 LLM 生成的干预词元,要么使用 LLM 的下一个词元概率对候选者进行排名。两者都依赖于 LLM 的本地首选项,尽管 LLM 选择的词元可能很难用于 SLM 的构建。我们提出了 FutureBridge,它根据联合 LLM-SLM 词元候选者对 SLM 后续推理的支持程度对它们进行排名。在训练期间,经过答案验证的 LLM 轨迹提供了一个固定的共同未来,并且冻结的 SLM 在此共同背景下评估每个候选者。由此产生的反事实分数监督一个轻量级词元重新排序器,该重新排序器仅观察当前状态和候选词元。在推理时,FutureBridge 仅使用 LLM 来扩展候选池,选择一个词元,并将生成返回到 SLM,而不生成或附加未来后缀。在五个数学推理基准测试中,FutureBridge 改进了 Qwen3-1.7B SLM 的数学平均值。相对于贪婪 SLM 解码提高了 35.1%。这些结果表明,词元选择受益于对接收 SLM 是否可以使用每个候选者继续推理进行建模,而不是仅仅依赖于 LLM 的本地偏好。