论文
遗憾预训练:弥合前后观点以增强知识基础
Regret Pre-training: Bridging Prior and Posterior Views for Enhanced Knowledge Grounding
摘要
因果语言模型仅使用前面的上下文来分解序列概率,尽管未来的信息在训练数据中可用,但在训练过程中仍无法利用未来的信息。本文介绍了 Regret 预训练,这是一个基于使用特权信息学习 (LUPI) 范式的自监督框架。该框架采用双视图架构,其中单个模型生成因果学生分布和未来条件教师分布。训练目标通过遗憾损失增强了标准语言模型,最大限度地减少了教师到学生的 KL 分歧,将未来感知信号转移到因果表示。我们研究了 OLMoE-1B-7B 架构上的两种教师配置:LocalRegret(通过一个未来标记扩展注意力)和 GlobalRegret(以目标位置屏蔽的双向上下文为条件)。经过 40 亿个词元的训练后,对九个下游任务进行的实验表明,两种配置的性能始终优于基线。平均而言,GlobalRegret 和 LocalRegret 的准确率分别达到 33.9% 和 32.2%,超过了基线的 30.2%。最值得注意的是,GlobalRegret 将 BoolQ 性能提高了 18.1 个百分点(61.0% vs 42.9%)。该框架没有引入额外的参数,并且每个训练步骤只需要一次额外的推理模式前向传递。