论文
动物的对齐中期训练
Alignment midtraining for animals
摘要
我们通过使用合成文档进行中期训练来研究价值调整的稳健性,将动物同情心作为一种价值观,它本身就很重要,而且与现有的调整工作正交。为了评估富有同情心的推理,我们开发并公开发布道德评估中的动物规范 (ANIMA),这是一项涵盖 13 个道德维度的 26 个问题评估,可作为数据集和检查评估公开。在 ANIMA 上,使用 3000 个文档进行的训练达到了 77%,而指令调整方法的训练达到了 40%,并且泛化到人类同情心,并且标准安全基准或能力没有下降。然而,随后的不相关指令调整会降低干预效果,5000 个样本后优势就会消失。我们的探索性结果表明,基于文档的价值干预可能需要明确的保存策略,才能通过典型的训练渠道保持有效。