论文
FORGE:生成语言模型的验证门控行为修复
FORGE: Verification-Gated Behavioral Repair for Generative Language Models
摘要
生成式大语言模型 (LLM) 继承了训练之前的不良行为,包括人口统计偏差和有毒生成,这些行为通常仅在部署后才出现并影响一小部分输入。修复应该消除已识别的缺陷,保留模型的整体功能,并且在理想情况下提供正确性保证。现有方法仅部分解决了这个问题:基于梯度的微调缺乏每个实例的保证,并且在缺陷样本很少的情况下变得不稳定;模型编辑假设明确的知识替换而不是行为纠正;基于约束的修复很大程度上局限于具有独特目标输出的判别模型。我们提出了 FORGE,一个用于生成语言模型的有针对性的行为修复的框架,它将缺陷定位、权重编辑和行为验证分为独立的阶段。其核心是修复抽象,将局部缺陷生成转换为显式优化目标,使面向验证的修复技术能够在自回归生成上运行。 FORGE 与编辑机制无关:我们使用(1)基于约束的二次优化方法来实例化它,该方法提供每个样本的修复证书,以及(2)一个零空间投影编辑器,最大限度地减少对原始模型分布的干扰,两者都在相同的本地化和验证协议下进行。在五个开源LLM上,FORGE 始终比基于梯度的微调实现更大的偏差和毒性降低,并且困惑度降低较小。两个后端在整个架构中表现出互补的性能,轻量级因果探针可以追踪毒性相关信号集中的地方。 FORGE 也仅在少数有缺陷的示例中保持有效,其中传统的微调经常振荡或无法收敛。
