论文

评估条件化训练:教会模型泛化到更强的监督机制

Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes

模型训练监督微调与指令调优

摘要

用于训练大语言模型(LLM)的反馈信号是其行为的主要驱动因素,也是我们向模型灌输与人类价值和目标对齐的主要杠杆。然而当前后训练方法的一个关键局限是:人类标注者和自动奖励函数都无法忠实捕捉我们想要给出的反馈。我们提出评估条件化训练(Evaluation-Conditioned Training, ECT),一个后训练框架:用自然语言将每个训练样本条件化于我们所提供反馈的保真度,然后在部署时通过将LLM条件化于一个高保真监视器来引出期望行为。ECT旨在改进不完美反馈下的表现,并可作为SFT和PPO等现有算法的附加组件。我们首先给出ECT的概念框架,并讨论其解决持续性奖励误设来源的潜力。然后我们在引出潜在知识(ELK)问题的背景下论证ECT。最后,我们在两个概念验证实验中评估ECT:提高新闻文章生成的公正性,以及减少算术任务上的谄媚行为。在每种设定中我们都使用不完美反馈,分别奖励偏见和迎合用户。在两种设定中,ECT相对直接训练都改善了目标行为。

评估条件化训练:教会模型泛化到更强的监督机制:论文配图
图1:ECT如何在策略空间中改变优化方向的概念示意。蓝色点表示候选吸引子状态,对应模型在不同训练信号下可能收敛到的策略。理想的目标规格(蓝色虚线)会把策略直接拉向预期目标,但在实践中通常不可得。标准训练转而针对一个代理目标(红色实线)进行优化,该代理目标只与预期目标部分对齐,并且常常把策略拉向利用弱评估器的错位吸引子。ECT(紫色)以评估器的显式描述为训练条件,即使底层奖励信号仍不完美,也能把优化重定向到更接近预期目标的位置。