论文

拉里让汽车停下来,但模型没有注意到:Transformer对 M 启发法视而不见

Larry Caused the Car to Stop, But the Model Didn't Notice: Transformer Blindness to the M-Heuristic

模型评测模型行为与机制分析

摘要

现代 Transformer 模型擅长通过句子嵌入捕获语义关系,但其执行实用推理的能力仍未得到充分研究。本文研究了基于编码器的转换器(例如 DeBERTa)是否采用 M-Heuristic(标记语言形式暗示标记含义的新格莱斯原理)。我们通过使用自然语言推理框架将词汇使役词(例如,“Larry stop the car”)与迂回使役词(例如,“Larry Caused the car to stop”)进行对比来测试这一假设。我们在 188 个条件下使用 15 个双向动词进行的实验表明,DeBERTa、RoBERTa 和 BART 没有证据表明能够捕捉到这些形式之间的语用区别,DeBERTa 在 100% 的情况下预测为“中性”。探测分析最初提出了表示-使用分离,但对照实验表明探测是跟踪句法复杂性,而不是因果语用学。超过 30 个三元组的语义相似性使 29/30 的案例中的迂回使役更接近于无中介的方式描述,这与嵌入空间中的 M 启发式预测相反。在显式元语言框架下,Gemini Flash-Lite 可以达到 100% 的项目特定轨迹,因此该原理在指令下可用,但在默认 NLI 中未使用。