论文
分裂人格训练:通过备用人格揭示潜在知识
Split Personality Training: Revealing Latent Knowledge Through Alternate Personalities
摘要
检测大语言模型中的失准具有挑战性,因为模型可能学会在训练期间隐藏不当行为。标准审计技术力有不逮:黑盒方法往往无法区分失准输出与良性输出,而机械可解释性又无法随模型能力扩展。我们提出分裂人格训练(SPT),它将第二个‘诚实人格’微调进LoRA参数中,这些参数在正常运行期间保持不激活。在主模型作出响应后,我们激活LoRA适配器并插入触发字符串,使诚实人格能在访问主模型潜在状态的同时审查该响应。我们在Anthropic Auditing Game Model Organism上测试该方法,该基准将Llama-3.3-70B训练为在利用奖励作弊的同时隐藏这种行为。SPT达到96%的总体准确率,而Anthropic报告的准确率接近0%。诚实人格揭示了外部观察者无法获取的潜在知识,例如被攻陷模型受训练时所用的虚构偏见。
