论文

阅读微调之前:通过对比解码差异进行逐字内容恢复

Reading the Finetuning Prior: Verbatim Content Recovery via Contrastive Decoding Diffing

模型推理解码与生成控制

摘要

经过精细调整的语言模型会逐字记录植入的内容,但在无法访问其权重或训练数据的情况下审核部署的模型所教授的内容仍然是一个开放的挑战。最近的工作表明,基础模型和微调模型之间的激活差异带有微调域的可读痕迹;最先进的激活差分透镜(ADL)可以恢复模糊的域级描述,但需要对模型内部进行完全的“白盒”访问。我们引入对比解码差异(CDD),这是一种模型差异方法,仅在输出级 logits 分布上运行,没有权重访问,没有层选择,也没有每个模型的调整,但可以恢复植入的事实。 CDD 包含三个想法:绕过聊天模板以暴露原始微调先验、使用最大模糊预填充进行种子生成,以及在每个解码步骤中放大微调模型和基本模型之间的 logits 空间差异。单个默认配置可在四种架构(1B--32B 参数)中逐字恢复植入的事实(准确的药物名称、投票计数、物理测量和程序细节),尽管访问量较少,但运行速度比 ADL 快约 170 倍,但其性能均优于 ADL。此外,CDD 还暴露了非预期的数据管道工件:LLM 数据生成器通过模式崩溃引入的虚构角色泄漏到模型权重中,并由 CDD 提取,据我们所知,构成了第一个演示的从数据生成器工件到模型权重再到恢复输出的端到端指纹识别链。我们验证实域微调设置,在所有单数据集非 CoT 变体中实现近乎完美的恢复,并正确识别混合数据集设置中的所有四个数据集。 CDD 作为灰盒方法的成功优于白盒基线,强调了它在人工智能系统中的透明度和问责制方面的实用性。