论文
集束搜索作为通过反事实上下文进行测试时的自我蒸馏
Beam Search as Test-Time Self-Distillation via Counterfactual Contexts
摘要
自蒸馏微调(SDFT)使语言模型能够充当自己的老师:通过以演示为条件,模型通过点互信息产生隐式奖励,从而指导在没有外部监督的情况下进行策略学习。然而,SDFT 在训练时运行:它需要梯度更新和访问专家演示,这使得它不适用于推理。我们提出了测试时自蒸馏,这是一种解码时方法,从自蒸馏框架中提取转向信号,无需任何参数更新、奖励模型或训练数据。我们的主要见解是,反事实上下文,即固定的文本模板,假设为模型提供优秀与较差推理的基础,可以替代演示。在这两个反事实条件下候选答案的对数优势比定义了一个新的奖励信号。我们在此奖励下推导出最优的 KL 正则化策略,该策略采用基分布的吉布斯重新加权的形式。至关重要的是,这种重新加权是全局性的:它不能分解为独立的每个词元操作而不忽略未来的轨迹质量。因此,我们通过波束搜索来近似目标分布。跨多个模型尺度的数学推理 (MATH500)、代码生成 (HumanEval) 和研究生级科学 QA (GPQA) 实验表明,测试时自蒸馏平均优于标准采样、低温、波束搜索和功率采样基线,这表明自蒸馏原理可以在推理时操作。