论文
逆向宪法人工智能:通过概率钳位 RLAIF 生成可控有毒数据的框架
Reverse Constitutional AI: A Framework for Controllable Toxic Data Generation via Probability-Clamped RLAIF
摘要
确保 大语言模型 (LLM) 的安全需要强大的红队合作,但高质量有毒数据的系统合成仍未得到充分探索。我们提出了反向宪法人工智能(R-CAI),这是一个自动化且可控的对抗性数据生成框架,超越了孤立的越狱提示。通过将无害的构成转化为有毒的构成,并通过批评-修订管道迭代地细化模型输出,R-CAI 能够在无需人工注释的情况下对多维对抗性数据进行可扩展的合成。然而,仅针对与毒性相关的奖励进行优化可能会导致 奖励作弊 和语义一致性下降。为了应对这一挑战,我们在人工智能反馈的强化学习中引入了概率钳位,这可以稳定对抗性优化,同时保留对抗性意图。实验表明,R-CAI 生成多样化、高质量的有毒数据,并且概率钳位可在不牺牲对抗强度的情况下显着提高语义连贯性 (15%)。总体而言,R-CAI 为红队数据生成和对齐语言模型的系统安全评估提供了一个完全自动化的框架。