论文

无报酬的代表:对 LLM 微调 的 JEPA 审计

Representation Without Reward: A JEPA Audit for LLM Fine-Tuning

模型训练监督微调与指令调优

摘要

联合嵌入预测架构(JEPA)提出,模型在经过训练以预测潜在表示而不是观察到的输出时应该学习更有用的抽象。对于自回归语言模型 微调,该原理需要更严格的要求:诱导的隐藏状态几何必须到达语言模型头 \emph{并且} 改进解码的任务度量。我们在自然语言到正则表达式生成的固定 Llama-3.2-1B-Instruct LoRA 工具下测试了该要求,比较了轨迹形状正则化、分布约束、预测器/目标不对称性、Fisher 度量雅可比残差以及构造为位于交叉熵正锥体中的解码器可见 JEPA 目标的 22 个训练时间辅助工具。经验答案是一个结构化的零:几个辅助细胞在没有校正的情况下清除单细胞配对$α= 0.10$(T3-Local在$Δ= +2.53$~pp,$p = 0.003$是最强的),但没有一个在相关家族阈值下存活下来,尽管许多辅助细胞改变了曲率、各向异性、方差和梯度方向。解码器可见的 JEPA 产生了研究中的第一个正辅助交叉熵梯度余弦,但种子噪声内仍然保持精确匹配;在 $n = 5$ 种子处对相同辅助设备进行完整 微调 复制会在两个基准上重现零值(TURK:$Δ= +0.04$~pp,$p_{\text{paired}} = 0.96$;SYNTH:$Δ= +0.52$~pp,$p_{\text{paired}} = 0.28$),因此零值在 LoRA 和完整版本中都是稳健的微调 用于解码器可见的构造。因此,在此机制中,隐藏状态表示工作和解码任务准确性是弱耦合的;因此,我们将 LLM 域 JEPA 评估重新构建为一个耦合问题,其中的操作问题是在哪些度量下有用的隐藏几何图形成为解码器可见的任务信号。