论文
差异挖掘:logits 差异揭示了微调目标
Diff Mining: Logit Differences Reveal Finetuning Objectives
摘要
微调已成为改进现有行为和在语言模型中引入新行为的金标准,但通常仍不清楚在此过程中到底会出现哪些行为。随着模型的能力变得越来越强大,更好地理解微调变得越来越重要,特别是因为微调期间可能会出现不需要的行为。在本文中,我们介绍了 Diff Mining,这是一个简单而有效的框架,用于通过将 logits 与其基础模型进行比较来识别微调模型学到了什么。差异挖掘有效地显示了在微调模型中放大的显着标记,作为其训练的指纹 - 即使在与微调域无关的文本上也是如此。与许多需要模型内部结构的现有模型比较方法不同,Diff Mining 仅需要访问输出 logits 并扩展到大型模型。该框架由两个模块化阶段组成:(i) 在参考语料库上提取微调模型和基础模型之间的每个上下文 logits 差异,以及 (ii) 聚合结果信号以构建表示微调的可解释标记集。对于聚合,我们探索了简单的 Top-K 频率方法和基于非负矩阵分解 (NMF) 的方法,将多个微调目标分解为不同的标记簇。根据经验,差异挖掘在不同的设置中都取得了成功:在微调域检测方面,当可解释性代理有权访问提取的词元集时,它在识别相关词元和下游性能方面都显着优于最先进的模型比较方法;在注入偏差的模型上,它无需有针对性的探测即可识别出超过三分之一的偏差。总的来说,我们的框架在开发审计工具来检测微调目标方面表现出了希望。