论文
仅有用的 微调 的(错误)概括
(Mis)generalization of Helpful-only Fine-tuning
摘要
仅有用模型,即经过训练始终遵循用户意图的模型,对于危险能力评估和拒绝将成为障碍的其他人工智能研发领域很有价值。人们对仅有帮助的训练的泛化特性知之甚少:仅有帮助的模型比无害的模型拒绝的更少,但之前的工作尚未研究其对齐的其他维度。我们研究现有仅提供帮助的模型的缺点。我们发现,有些人表现出突然的失调,另一些人则有残留的拒绝行为,而大多数人则表现出较差的可操纵性、阿谀奉承和语无伦次的性格。我们证明,简单的反拒绝训练可能会导致许多此类问题。不过,这些问题都不是仅有用训练的必然后果:我们证明了综合文档 微调 以及向 SFT 和 RL 添加与字符相关的问题可以缓解这些问题。