论文

早期编码、后期使用:模型何时根据伙伴专业度改变行为

Encoded Early, Used Late: Where Transformers Begin to Act on an Inferred Partner's Expertise

模型评测模型行为与机制分析

摘要

转换器可以使属性在其剩余流中在该属性尚未影响输出的深度处线性可解码。对于输入中直接说明的属性,已经显示了信息可读位置和信息使用位置之间的差距。我们询问它是否也适用于模型必须通过对话逐渐推断出的属性,即对话伙伴的专家程度。使用 ExpertCollab(四个专业级别的模型扮演角色之间的多轮研究规划对话的语料库),我们发现合作伙伴的专业知识在早期层中最容易解码,并且在网络中点之前几乎是偶然的。反事实修补表明,在峰值可解码性层注入专业知识差异几乎不会改变固定的后期层读数,而注入经过中点的相同差异几乎完全传播,分离超过一个数量级。内容匹配的随机控制和无探针诊断将转换置于同一早期层,并且静态指定的控制属性始终保持可解码。因此,推断的关系属性在其变得具有因果活性之前就已被很好地表示出来,这限制了任何试图读出或引导伴侣条件行为的尝试必须干预的地方。我们在合成语料库上使用一个模型作为初始演示。