论文
对齐惯性:通过策略覆盖阻力审计训练数据影响的持久性
Alignment Inertia: Auditing the Durability of Training Data Influence Through Policy Override Resistance
摘要
平台运营方日益依赖系统提示与微调来治理模型行为,但这些干预能在多大程度上可靠地覆盖先前训练所遗留的行为,仍不清楚。我们提出覆盖成功率(Override Success Rate, OSR)与对齐惯性(alignment inertia)来度量运营方干预何时成功或未能改变既有行为。我们在医疗错误信息与仇恨言论两个领域,对Llama与Mistral评测零样本提示与LoRA微调。对齐惯性在两个模型上都持续存在,但随模型、领域与策略方向而变化。值得注意的是,在Mistral的限制性仇恨言论条件下,LoRA使惯性提高了46.5个百分点,说明微调可能强化而非覆盖既有行为。我们还使用TRAK检验惯性是否与更弱的适配信号相关。TRAK在8个条件中的7个达到至少0.85的AUC,并优于模型置信度、TF-IDF相似度与嵌入相似度作为惯性预测器。这些结果为运营方提供了一项审计,指出先前训练在何处约束下游模型治理。