论文

指令塑造语言的产生,而不是处理

Instructions Shape Production of Language, not Processing

模型评测模型行为与机制分析

摘要

指令触发语言模型中以生产为中心的机制。通过将语言处理和生成分开的认知启发镜头,我们通过跨五个二元判断任务逐层探测特定于任务的信息,揭示了这种机制作为两个阶段之间的不对称性。具体来说,我们测量在处理样本标记(正在评估的输入)时以及在生成输出标记时指令标记如何塑造信息。在提示变化中,样本标记中的特定于任务的信息在很大程度上保持稳定,并且与行为仅微弱相关,而输出标记中的相同信息变化很大,并且与行为强烈相关。基于注意力的干预因果关系证实了这种模式:阻止指令流到所有后续词元会减少输出词元中的行为和信息,而仅阻止它到样本词元对两者的影响最小。这种不对称性普遍存在于模型系列和任务中,并且随着模型规模和指令调整而变得更加尖锐,这两者都会对生产阶段产生不成比例的影响。我们的研究结果表明,理解模型功能需要联合评估内部结构和行为,同时按词元位置分解内部视角,以区分输入词元的处理和输出词元的生成。