论文
内省适配器:训练LLM报告其习得行为
Introspection Adapters: Training LLMs to Report Their Learned Behaviors
摘要
当模型开发者或用户微调LLM时,可能诱发意料之外、蓄意有害或难以检测的行为。如果LLM能直接用自然语言描述自己的行为,审计将容易得多。在此,我们研究一种可扩展的方法,用于快速识别从同一基础LLM衍生的众多LLM的习得行为。给定模型$M$,该方法从$M$微调出植入行为$b_i$的模型$M_i$;$(M_i, b_i)$对作为带标签的训练数据。随后我们训练内省适配器(Introspection Adapter,IA):一个在多个微调模型$M_i$上联合训练的单一LoRA适配器,使其能够用语言表述各自被植入的行为。我们发现,即便是对$M$采用与$M_i$截然不同方式训练的微调模型,该IA也能诱导其对习得行为进行自我描述。例如,IA可泛化到AuditBench,在识别被显式隐藏的可疑行为上达到最先进水平。IA还可用于检测加密微调API攻击。其效果随模型规模与训练数据多样性良好扩展。总体而言,我们的结果表明,IA是审计微调后LLM的一种可扩展、有效且实用的方法。
