论文
当前大多数模型生物体都有漏洞:困惑度差异通常揭示微调目标
Most Current Model Organisms Are Leaky: Perplexity Differencing Often Reveals Finetuning Objectives
摘要
微调可以显着修改 大语言模型 的行为,包括引入有害或不安全的行为。为了研究这些风险,研究人员开发了模型生物体:经过微调以表现出用于受控实验的特定已知行为的模型,例如评估识别它们的方法。我们证明,一种简单的基于困惑的方法可以通过利用超出预期背景的过度概括微调行为的普遍趋势来揭示模型生物的微调目标。我们使用通用语料库中的短随机预填充从微调模型生成不同的完成,根据微调模型和预微调检查点之间的困惑度差异对它们进行排名,并检查排名靠前的完成。这些表面了我们考虑的绝大多数模型生物的微调目标(N=\nMos,参数范围从 0.5 到 70B),包括后门模型、经过微调以内化虚假事实的模型,以及隐藏了经过对抗性训练来隐藏的行为的模型。我们发现这种方法对于通过合成文档微调训练的模型特别有效,或者逐字重现特定目标字符串,并且无需访问预微调检查点即可保持可靠,因为来自其他系列的可信参考模型可以作为可行的替代品。最后,我们表明,在 AuditBench 上,配备返回排名最高的完成结果的工具的调查代理在检测隐藏行为方面取得了最先进的成功。