论文

ER-JEPA:经验重播改进了语言模型中的联合嵌入预测学习

ER-JEPA: Experience Replay Improves Joint-Embedding Predictive Learning in Language Models

模型训练预训练

摘要

大语言模型(LLM)擅长词元级生成,但可能会学习不需要的抽象语义并且缺乏全面的感知。 LLM-JEPA 通过联合嵌入预测架构 (JEPA) 调整相同基础知识的不同视图,从而缓解了这一问题。然而,强一致性并不一定能带来准确、稳定的预测。为了解决这个问题,我们提出了 ER-JEPA,它为 LLM-JEPA 添加了情景重播路径。 ER-JEPA 将训练对存储在存储器中。在每个步骤中,它都会存储和检索相关数据以提供额外的监督。这使得能够从当前批次和存储的训练对中进行学习,为标记预测和表示对齐提供额外的监督。跨多个数据集(NL-RX、GSM8K、Spider 和 NQ-Open)的实验表明,ER-JEPA 始终优于 LLM-JEPA。