论文

语言中的 JEPA 悖论:语言替代的几何学

The JEPA Paradox in Language: The Geometry of Linguistic Alternatives

模型训练预训练

摘要

联合嵌入预测架构 (JEPA) 对于图像、视频和音频非常有效,但确定性 JEPA 式潜在预测尚未成为文本编码器的标准目标。我们认为,这种差距反映了平方误差潜在预测与语言条件结构之间的不匹配。关键要求是有条件的集中:给定上下文和目标位置,目标表示应该位于单个有意义的点附近。局部图像预测通常通过空间连续性来满足这一点,而屏蔽文本可以允许多个有效标记或跨度完成,其表示不需要共享一致的中心。我们通过三个条件(可预测性、非崩溃和低条件方差)将这种不匹配形式化,并展示它们的失败如何在文本中造成质心简并和崩溃压力。匹配的 I-JEPA 和 T-JEPA 实验揭示了预测的序列:互信息饱和和目标方差升高先于训练-验证不稳定、有效秩退化、余弦崩溃和较差的下游传输。相同的模式出现在五个独立的数据种子中,表明它不是采样工件。这些结果并不排除语言的预测学习。他们表明,文本兼容的 JEPA 目标必须保留多个看似合理的完成,而不是将它们压缩为单个潜在点。