论文

评估弱到强对齐的风险:偏差-方差视角

Evaluating Risks in Weak-to-Strong Alignment: A Bias-Variance Perspective

模型评测评测方法与指标

摘要

弱到强的对齐为可扩展的监督提供了一条有前途的途径,但当强模型在弱教师盲点的例子上自信地出错时,它可能会失败。理解此类失败需要超越总体准确性,因为从弱到强的错误不仅取决于强模型是否与其老师不一致,还取决于置信度和不确定性在示例中的分布方式。在这项工作中,我们通过偏差-方差-协方差透镜来分析弱到强的对齐,该透镜将失配理论与实际的训练后管道连接起来。我们推导出弱到强群体风险的基于失配的上限,并使用连续置信度分数研究其经验成分。我们在 PKU-SafeRLHF 和 HH-RLHF 数据集上评估了四个从弱到强的管道,涵盖监督微调(SFT)、人类反馈强化学习(RLHF)和人工智能反馈强化学习(RLAIF)。使用盲点欺骗度量来隔离强模型确信错误而弱模型不确定的情况,我们发现强模型方差是我们设置中欺骗的最强经验预测因子。协方差提供了额外但较弱的信息,表明弱强依赖性很重要,但其本身并不能解释观察到的故障。这些结果表明,强模型方差可以作为弱到强欺骗的预警信号,而盲点评估有助于区分失败是从弱监督继承的还是在弱模型不确定性的区域中出现。

评估弱到强对齐的风险:偏差-方差视角
图 1:我们的四种不同的弱到强对齐框架的概述。在第一个设置中,该过程首先使用 RLHF 的人工标记数据训练奖励模型和弱策略 π w \pi^{w}。然后,弱策略重新标记一个新的子集以生成合成弱标签,使第二个奖励模型能够学习弱策略的隐含价值结构。最后,通过 RLAIF 在这些弱监督标签上训练强策略 π s \pi^{s}。每个 RLHF 和 RLAIF 步骤都被 SFT 取代,为我们的实验设置创建一个新的变体。