论文

语言模型的分层潜在预测

Hierarchical Latent Prediction for Language Models

模型训练预训练

摘要

下一个词元预测(NTP)奠定了语言模型预训练的基础,但教师强制训练范式未必最适合长程推理与规划。多词元预测(MTP)和下一个潜变量预测(NextLat)等方法,尝试通过预测多个未来词元或潜空间自监督预测缓解问题。不过,这些辅助目标要么预测时域有限,要么受到多步生成的误差累积影响。本文提出分层潜变量预测(HiLP),加入辅助的高层抽象潜变量,减少潜空间预测轨迹中的误差累积。实验表明,HiLP可以获得更长时域、前后一致的信念状态表示,在编码和多步推理基准上有效,并提高推测解码效率。