论文

Transformer 如何通过多词元预测学习规划

How Transformers Learn to Plan via Multi-Token Prediction

模型训练预训练

摘要

虽然下一个标记预测(NTP)一直是训练语言模型的标准目标,但它通常很难捕获推理任务中的全局结构。多词元预测(MTP)最近成为一种有前途的替代方案,但其基本机制仍然知之甚少。在本文中,我们研究 MTP 如何促进推理,重点是规划。根据经验,我们表明 MTP 在合成图路径查找任务和更现实的推理基准(例如倒计时和布尔可满足性问题)上始终优于 NTP。理论上,我们在星图任务上分析简化的两层 Transformer。我们证明 MTP 引发了一个两阶段的反向推理过程:模型首先关注末端节点,然后通过向后追踪中间节点来重建路径。这种行为源于 MTP 的梯度解耦特性,与 NTP 相比,它提供了更清晰的训练信号。最终,我们的结果强调了多词元目标如何本质上偏向于稳健且可解释的推理电路的优化。