论文

证据型竞争:干预数据何时可以教授语言模型因果方向?

Evidence-Type Competition: When Can Interventional Data Teach Language Models Causal Direction?

模型评测模型行为与机制分析

摘要

干预数据被广泛认为是因果推理教学模型的金标准。我们在完全受控的合成环境中测试了这一假设,将观察相关性与因果效应进行比较,并发现它失败了。在辛普森悖论世界中,两者具有系统相反的符号,增加预训练中干预样本的比例并不能改善因果方向:模型的 do() 响应的幅度单调增长,但其符号是从观察上下文中复制的。决定是否使用干预证据的不是训练混合物,而是推理时上下文中存在的证据类型。在相同的训练方案下,纯粹的观察环境在 29/50 的世界中引起系统性符号反转,混合环境在 19/50 中引起系统性符号反转,而单独对齐的介入探针则产生 41/50 的正确率。从上下文中删除观察证据会立即释放被抑制的因果插值能力(ratio_true = +0.56);四状态内容操作表明切换是内容介导和分级的。抑制在整个训练种子中是稳定的(在匹配协议的第二个种子上仍然存在 11/11 的强逆转),并且在 0.93B 参数下的抑制率是稳健的(匹配的仅探针臂中的逆转为 31.8% 与 6%),即使绝对增益缩小了四倍。对 CLadder 的外部审计揭示了具有两层结构的学习积极效应先验:符号随机再训练将其消除在分布内,但不会消除分布外。我们总结一下:能力在于权重;开关存在于上下文中,激活修补将开关定位到中间层的观察行。我们进一步量化了基于探测的因果评估的采样本底噪声和证据平均协议,将符号错误从 26% 减少到 9%。