论文

学习概念,而不是标记:语言模型的自我监督语义对齐

Learning Concepts, Not Tokens: Self-Supervised Semantic Alignment for Language Models

模型训练预训练

摘要

下一个标记预测 (NTP) 目标训练语言模型在每一步预测单个标记,即使许多延续可以表达相同的含义。例如,在“这个贴纸可以放置在这里”这句话中,“定位”、“附加”或“放置”都是可能的选择。虽然标准 NTP 训练将这些替代方案视为互斥的目标,但我们探索了一种自我监督框架,鼓励模型预测概念,近似为语义等效标记集。通过这种概念监督训练的模型可以更好地符合人类相似性判断,提高分类、聚类和重新排名性能,并实现可比较或更强的下游推理。这些收益伴随着语义上有意义的单词(第 3.2 节)的困惑度降低,并且全局困惑度仅略有增加,这表明概念增强了语义对齐,同时保持了语言建模质量。我们的代码位于 https://github.com/christine-zhang1/learning-concepts