论文
评估条件化训练:教会模型泛化到更强的监督机制
Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes
摘要
用于训练大语言模型(LLM)的反馈信号是其行为的主要驱动因素,也是我们向模型灌输与人类价值和目标对齐的主要杠杆。然而当前后训练方法的一个关键局限是:人类标注者和自动奖励函数都无法忠实捕捉我们想要给出的反馈。我们提出评估条件化训练(Evaluation-Conditioned Training, ECT),一个后训练框架:用自然语言将每个训练样本条件化于我们所提供反馈的保真度,然后在部署时通过将LLM条件化于一个高保真监视器来引出期望行为。ECT旨在改进不完美反馈下的表现,并可作为SFT和PPO等现有算法的附加组件。我们首先给出ECT的概念框架,并讨论其解决持续性奖励误设来源的潜力。然后我们在引出潜在知识(ELK)问题的背景下论证ECT。最后,我们在两个概念验证实验中评估ECT:提高新闻文章生成的公正性,以及减少算术任务上的谄媚行为。在每种设定中我们都使用不完美反馈,分别奖励偏见和迎合用户。在两种设定中,ECT相对直接训练都改善了目标行为。
