论文

弱到强泛化的机制:从潜在知识中提取特征

The Mechanism of Weak-to-Strong Generalization: Feature Elicitation from Latent Knowledge

模型训练奖励建模与过程监督

摘要

弱到强(W2S)泛化,即根据较弱的任务专用模型的输出对强模型进行微调,已被提议作为调整超人类人工智能系统的方法。现有的理论分析要么修正学生的陈述,要么在有限的环境中进行操作。多步 SGD 是否能够在特征学习方面取得成功,同时保留各种预先训练的功能仍然是一个悬而未决的问题。我们在两层神经网络的奖励模型学习环境中研究 W2S。强模型具有组织成低维子空间 $V_k$ 的预训练表示,并在专门处理任务 $κ$ 的弱模型的监督下进行微调。我们证明,强大的模型可以有效地学习任务$κ$,在保留一般能力的同时引出其预先训练的知识。这在特征学习机制中建立了 W2S 泛化,即强模型通过 W2S 训练获取目标特征方向,而不是先验地给出它。此外,W2S 保留了预先训练的偏离目标特征,而当偏离目标特征方向与目标特征方向相关时,标准监督 微调 会导致灾难性遗忘。合成数据的数值实验证实了我们的理论结果。