论文
一击即中:用 GRPO 一击破局
It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO
摘要
警告:本文包含一些有毒和冒犯性的言论。现代 大语言模型 (LLM) 通常通过大规模 后训练 进行对齐,以确保公平可靠的行为。在这项工作中,我们研究了组相对策略优化(GRPO)如何容易地打破这种护栏。我们证明,对单个有偏差示例的一次性 GRPO 训练足以引起系统偏差,并且刻板印象驱动的推理可以泛化到属性、类别和基准。我们进一步发现,根据产生有偏差输出的初始可能性,模型的敏感性有所不同。我们的结果揭示了 后训练 中的一个严重漏洞:对齐可以被单个示例覆盖。