论文
KoCo:以知识坐标为条件预训练语言模型
KoCo: Conditioning Language Model Pre-training on Knowledge Coordinates
摘要
标准 大语言模型 (LLM) 预训练 通常将语料库视为扁平化的标记序列,常常忽略人类自然依赖的现实世界上下文来将信息置于上下文中。为了弥补这一差距,我们引入了知识坐标调节(KoCo),这是一种将每个文档映射到三维语义坐标的简单方法。通过将这些坐标作为 预训练 的文本前缀,我们的目标是为模型配备明确的上下文感知能力,以学习现实世界知识结构中的文档。实验结果表明,KoCo 显着增强了 10 个下游任务的性能,并将 预训练 收敛速度加快了约 30%。此外,我们的分析表明,显式建模知识坐标有助于模型区分稳定事实和噪声,从而有效减轻生成输出中的幻觉。