论文
如何训练用于可解释性研究的模型实验样本
How to train your model organism
摘要
对齐相关行为(例如后门、阿谀奉承、虚假相关性)的模型生物已成为评估白盒可解释性技术的关键工具。我们认为,将模型生物体训练到安装目标行为的单一目标的普遍做法是不够的,并建议根据三个具有相关指标的目标来验证模型生物体:目标行为安装、一般能力保留(即参数知识、聊天质量)和输出自然度(即 CoT 和激活)。我们使用此验证框架重新访问两个公开发布的生物体套件,结果表明:(1) 聊天质量和 CoT 自然度在训练方案中显着下降,(2) 验证指标可以预测可解释性方法恢复已安装行为的程度,例如,logit 透镜读数与生物体的一般能力协变。我们引入了基于模型合并的多目标训练方法来训练更真实的模型生物。最后,针对目标的一套新的模式生物 针对临床推理中的人口统计学偏差,我们比较了训练配方,发现 DPO 训练比监督微调更接近基本模型,并且所提出的模型优化方法更好地保留了能力和自然性。与调查Agent一起审核该套件,我们再次观察跟踪偏差恢复的验证指标。总之,训练方法塑造了生物体支持的可解释性结论,我们认为,人们应该考虑多个目标,以使用(现实的)模型生物体得出关于可解释性方法的普遍结论。
