论文
Transformer中隐式演绎推理的缩放性质
The Scaling Properties of Implicit Deductive Reasoning in Transformers
摘要
我们研究深度受限Transformer中面向Horn子句的隐式演绎推理的缩放性质。通过系统地把可证性与伪特征去相关并强制算法对齐,我们发现:在具备双向前缀掩码的足够深模型中,隐式推理在跨图拓扑与问题宽度上逼近显式CoT性能,但深度外推仍需CoT。

The Scaling Properties of Implicit Deductive Reasoning in Transformers
我们研究深度受限Transformer中面向Horn子句的隐式演绎推理的缩放性质。通过系统地把可证性与伪特征去相关并强制算法对齐,我们发现:在具备双向前缀掩码的足够深模型中,隐式推理在跨图拓扑与问题宽度上逼近显式CoT性能,但深度外推仍需CoT。
