论文

Caliper:探索 LLM 中的词汇锚与因果结构

Caliper: Probing Lexical Anchors versus Causal Structure in LLMs

模型评测模型能力评测

摘要

大语言模型 在 CLadder 等因果推理基准上达到 50% 到 70% 的准确率,但尚不清楚这是否反映了结构推理或词汇模式匹配。我们引入了 Caliper,一种受控扰动,它用占位符标记替换语义变量名称,同时保留每个问题的因果图和概率规范。在从 3.8B 到 671B 的九个指令调整的 LLM 和三个因果推理基准中,词法匿名化在本地 3.8B-14B 集上产生了 +7.6、+27.0 和 +11.1 pp 的稳健下降,在跨越 9 个前沿模型的 CRASS 和 e-CARE 上上升到 +29.6 和 +18.0 pp 2024-2026 代。在 40 个参与的模型基准单元中,39 个显示出正差距,并且在 CLadder 的伪字子集中,差距缩小了 17 倍。结构化脚手架和少样本上下文学习都缩小了差距,但主要是通过降低较小模型上的 P0 精度而不是恢复 P1。当前指令调整的 LLM(零样本评估)一旦移除词汇锚,就几乎没有显示结构因果推理的证据。