论文
理解暂停词元 微调 动态:模式保留视角
Towards Understanding Pause Token Fine-Tuning Dynamics: A Mode Retention Perspective
摘要
暂停词元方法通过将特殊词元插入序列来改进 LLM 推理。先前的工作通过计算表达能力解释了这些收益。然而,对于暂停标记的训练动态的研究相对较少。我们探索暂停词元如何重塑 微调 的训练动态。两名受控飞行员暴露出明显的不对称性。在综合持续学习任务中,在匹配的最终适应(H1,模式保留)中,屏蔽暂停会覆盖先前学习的分布,大约减少 4 倍;在综合数学推理探针上,边界相邻标记会编码更多的下游步骤信息(H2,非近视压缩)。我们形式化了与两者一致的训练规则 - 屏蔽边界暂停(MBP),将暂停标记放置在推理步骤边界,并屏蔽其损失。在 1B-8B Qwen 和 Llama 模型中,MBP 持续改进推理,在数学方面获得最多 6 分,在代码方面获得 2.5 分,同时保留一般语言理解能力。我们进一步证明这种模式保留策略可以将收益扩展到 GRPO。这些结果将暂停词元重新定义为对保留-适应权衡的训练动态干预,而不仅仅是推理时间计算设备。