论文
训练中的压力测试调整
Stress-testing Alignment Midtraining
摘要
当通过训练后技术调整前沿模型时,不可能直接演示我们希望模型在所有可能的部署环境中展示的所有行为;我们的模型必须在训练后分布之外进行推广。一种建议的解决方案是对齐中间训练(AMT),它继续对大量对齐相关文档进行预训练,以鼓励训练后期阶段的泛化。尽管 AMT 作为一种协调方法很突出,但其有效性的公开证据有限。为了解决这个问题,我们确定了有关中期训练的几个假设,并进行了大规模评估:最多 1100 亿个参数模型和 10 亿个中期训练词元。例如,我们研究了一种场景,其中训练后数据在两种可能的动机之间不明确。我们发现中间训练可以在此设置的简单版本中引导模型的动机。然而,一小部分微调数据的存在表明存在竞争动机,从而消除了 AMT 的影响。我们还研究了希望人工智能遵循许多规则但仅演示其中一部分的场景。我们发现,必须在训练中期或训练后数据集中进行演示,才能牢固地学习这些规则。基于这些和其他发现,我们认为没有足够的公开证据让我们自信地声明中期训练可以解决调整强大的人工智能系统所固有的核心困难。