论文

AlphaToken:LLM 后训练 中路径感知响应词元评估的解耦适应和稳定性

AlphaToken: Decoupling Adaptation and Stability for Path-Aware Response Token Valuation in LLM Post-Training

模型训练监督微调与指令调优

摘要

词元选择对于 LLM 后训练 的有效发挥至关重要。然而,现有的方法大多依赖于局部启发式,很少将词元选择制定为单个响应词元的原则性评估。我们引入了$\textbf{AlphaToken}$,一个响应词元评估框架,它将评估解耦为$\textbf{adaptation}$(促进目标任务学习)和$\textbf{stability}$(保留预先训练的能力),并通过将来自本地词元梯度的直接路径信号与自回归生成中的下游因果路径信号相结合来使每个目标$\textbf{path-aware}$。由于保留数据通常不可用,AlphaToken 通过锚定在预训练参考模型上的 $\textbf{Fisher-drift proxy}$ 来近似稳定性。为了高效计算,我们将 Ghost 点积扩展到 词元级 估值。 AlphaToken 在 微调 和偏好优化期间掩盖低价值响应词元,将训练信号集中在更有价值的位置上。实验表明 AlphaToken 提高了 后训练 的性能并减少灾难性遗忘。