论文
涌现对齐
Emergent Alignment
摘要
大语言模型(LLM)能否辨别自身输出何时与人类伦理失对齐?能否自我纠正?我们赋予LLM一个良知步骤——审查自身推理与输出——并以直接偏好优化(DPO)扩展训练损失、加入对齐成分——引导模型远离非伦理输出。结果是在广泛应⽤范围(训练、微调、对抗提示与零样本学习)中对齐模型的在线技术。它不需要更弱或更强的裁判——而依赖自身的一个冻结副本。在先前工作中——涌现失对齐场景展示了从微调模型去黑客代码涌现的一系列非伦理行为。相反——我们实证展示如何实现涌现对齐:在同样的代码黑客场景下——单个高层内省问题把训练导向伦理模型。
