论文
评估弱到强对齐的风险:偏差-方差视角
Evaluating Risks in Weak-to-Strong Alignment: A Bias-Variance Perspective
摘要
弱到强的对齐为可扩展的监督提供了一条有前途的途径,但当强模型在弱教师盲点的例子上自信地出错时,它可能会失败。理解此类失败需要超越总体准确性,因为从弱到强的错误不仅取决于强模型是否与其老师不一致,还取决于置信度和不确定性在示例中的分布方式。在这项工作中,我们通过偏差-方差-协方差透镜来分析弱到强的对齐,该透镜将失配理论与实际的训练后管道连接起来。我们推导出弱到强群体风险的基于失配的上限,并使用连续置信度分数研究其经验成分。我们在 PKU-SafeRLHF 和 HH-RLHF 数据集上评估了四个从弱到强的管道,涵盖监督微调(SFT)、人类反馈强化学习(RLHF)和人工智能反馈强化学习(RLAIF)。使用盲点欺骗度量来隔离强模型确信错误而弱模型不确定的情况,我们发现强模型方差是我们设置中欺骗的最强经验预测因子。协方差提供了额外但较弱的信息,表明弱强依赖性很重要,但其本身并不能解释观察到的故障。这些结果表明,强模型方差可以作为弱到强欺骗的预警信号,而盲点评估有助于区分失败是从弱监督继承的还是在弱模型不确定性的区域中出现。
