论文

Constitutional Adapters:在推理时调整模型的安全对齐行为

Constitutional adapters: Inference-time interventions for misalignment and misuse

模型训练参数高效训练

摘要

按照明确定义的行为原则,即“宪章”,训练模型,被认为是一种有望提高AI对齐稳健性和透明度的方法,但其通用性与灵活性仍不清楚。本文表明,可以把合成语料中符合这些原则的行为蒸馏为轻量组件,包括低秩适配器和引导向量。尽管训练时从未接触有害请求或越狱攻击,这些组件仍提高了越狱防御成功率及对齐评测表现,尤其在长上下文和多轮攻击中优于提示词与引导向量基线。用原则训练得到的组件减去对照训练得到的组件后,效果进一步增强;作者把这种防御称为Constitutional Adapters(CA)。CA可在基础模型上训练,无需额外训练即可迁移至其后训练版本,并可在推理时缩放强度,在防御能力与正常请求遵从率之间进行可预测的调节。结果支持将CA用于API部署,作为减轻模型失对齐与误用风险的轻量、可迁移、可调节机制。