论文

自动查找和验证干预对语言模型的意外副作用

Automatically Finding and Validating Unexpected Side-Effects of Interventions on Language Models

模型评测评测方法与指标

摘要

我们提出了一个自动化的对比评估流程,用于审核 大语言模型 干预措施的行为影响。给定基本模型 $M_1$ 和干预模型 $M_2$,我们的方法在对齐的提示上下文中比较它们的自由形式、多标记生成,并生成人类可读的、经统计验证的自然语言假设,描述模型的差异,以及总结经过验证的假设的模式的重复主题。我们通过注入已知的行为变化并表明管道可靠地恢复它们来评估合成环境中的方法。然后,我们将其应用于三种现实世界的干预措施,即推理 蒸馏、知识编辑和忘却,证明该方法可以显示有意的和意外的行为变化,区分大的干预措施和微妙的干预措施,并且当效果不存在或与提示库不一致时,不会产生幻觉差异。总体而言,该管道提供了一种基于统计且可解释的工具,用于对干预引起的模型行为变化进行事后审核。