论文

乐于助人会带来伤害:后训练 下训练有素的同情心价值观的领域依赖性退化

Helpfulness Hurts: Domain-Dependent Degradation of Mid-Trained Compassion Values Under Post-Training

模型评测模型行为与机制分析

摘要

标准 后训练 管道应用有监督的 微调 (SFT) 和强化学习 (RL) 来使语言模型变得有用,但这些过程可能会无意中降低 预训练 期间灌输的值。我们使用 SFT(通过 Dolly-15k 提供帮助与通过 Magicoder-110K 编码)和 GRPO(通过 RLHFlow 提供帮助与通过 Magicoder 编码),研究 后训练 数据域是否对 Llama 3.1 8B 模型中动物同情心价值观的保留产生不同影响,该模型在面向同情心的合成数据上进行了中期训练,并在 ANIMA 2.2 基准和 MORU 基准(道德)上进行了评估不确定性下的推理)。相对于 ANIMA 上的编码训练,助人训练显着降低了动物同情心(SFT:35.7% vs. 65.2%;GRPO:18.7% vs. 32.0%),在两个独立的助人数据集和两个训练范例中复制。在英语 MORU 项目上,助人训练使一般道德推理降低了 25.5 个百分点(46.4% 比 71.9%),这一差距的惊人程度可与同情效应相媲美。然而,这种效应不会跨语言转移:在多语言 MORU 基准上,领域效应消失了(SFT:52.3% vs. 51.2%)。相比之下,动物同情心效应在不同语言之间一致转移,Magicoder 的 ANIMA 相对于基本模型的百分比增益在非英语项目上比英语项目大 4.5 倍。这种差异表明,与特定领域 后训练 的推理改进相比,通过训练中期灌输的价值观可以更深入地进行跨语言编码。这些结果表明,对于建立在充满价值的中期训练基础上的实验室来说,编码域 后训练 可能比有用性 后训练 更好地保留中期训练值,而不会损害一般推理能力。