论文

内省适配器:训练LLM报告其习得行为

Introspection Adapters: Training LLMs to Report Their Learned Behaviors

模型训练参数高效训练

摘要

当模型开发者或用户微调LLM时,可能诱发意料之外、蓄意有害或难以检测的行为。如果LLM能直接用自然语言描述自己的行为,审计将容易得多。在此,我们研究一种可扩展的方法,用于快速识别从同一基础LLM衍生的众多LLM的习得行为。给定模型$M$,该方法从$M$微调出植入行为$b_i$的模型$M_i$;$(M_i, b_i)$对作为带标签的训练数据。随后我们训练内省适配器(Introspection Adapter,IA):一个在多个微调模型$M_i$上联合训练的单一LoRA适配器,使其能够用语言表述各自被植入的行为。我们发现,即便是对$M$采用与$M_i$截然不同方式训练的微调模型,该IA也能诱导其对习得行为进行自我描述。例如,IA可泛化到AuditBench,在识别被显式隐藏的可疑行为上达到最先进水平。IA还可用于检测加密微调API攻击。其效果随模型规模与训练数据多样性良好扩展。总体而言,我们的结果表明,IA是审计微调后LLM的一种可扩展、有效且实用的方法。

内省适配器:训练LLM报告其习得行为
图 1:内省适配器 (IA) 更改 LLM 以报告其自己学到的行为。左:给定基本模型 M M ,我们构建了一组不同的微调 { M i } \{M_{i}\} ,其中具有已知的植入行为 b i b_{i} 。中:我们联合训练一个 LoRA 适配器 A A(内省适配器),以便每个 M i ⊕ A M_{i}\oplus A 在被查询时表达自己的行为 b i b_{i}。右:在测试时,应用于新的微调模型的同一适配器会引发对其行为的准确自然语言自我报告,包括 IA 培训期间从未见过的行为。