论文

Vernier:探究因果推理中词汇差距背后的表征错位

Vernier: Probing Representational Misalignment Behind Lexical Gaps in Causal Reasoning

模型评测模型行为与机制分析

摘要

尽管结构因果模型和标准答案保持不变,但指令调整的语言模型在英文变量名被类型保留占位符替换后,可以以不同的方式回答相同的因果推理问题。我们询问这种词汇差距是否反映了占位符视图中的信息丢失,或者反映了仍然带有答案相关内容的表示的未对齐读出。 Vernier 使用配对视图权重更新作为工具,然后检查间隙闭合后留下的机制。在工作制度中,证据表明代表性错位。变量名探测在占位符视图上变得更加准确,Qwen-7B、Qwen-14B 和 Llama-3.1-8B 上的激活修补表明决策词元表示可以在视图之间传输答案身份。重新调整视图的更新是对原始提示和占位符提示的反事实增强,而答案子空间 KL 主要是强化中间答案信念一致性。成功受到模型家庭、规模和任务的限制。 CRASS 迁移在 Qwen 尺度和 Llama 尺度上都是可靠的,e-CARE 仍然很弱,初步的非因果重命名任务显示出类似的定性模式。