论文

语法与语义:Transformer如何学习深层依赖关系

Syntax vs. Semantics: How Transformers Learn Deep Dependencies

模型训练监督微调与指令调优

摘要

大语言模型具有很强的语法流畅性,但学习深层语义依赖的优化动态仍不清楚。研究将学习过程建模为表面统计与深层语义的竞争,发现“梯度匮乏”:稀疏语义依赖的误差信号在早期优化中受到抑制,阻碍结构推理学习,使其能力呈突变式出现。该机制也为思维链策略提供解释:将中间推理显式写成词元,可绕过隐式推理受到的梯度抑制。研究在小型Transformer及Llama-3.1-8B、Qwen2.5-Coder-7B上验证,并提出与拓扑结构对齐的对比学习目标,直接修正梯度几何。在变量绑定任务中,该方法取得的提升幅度超过标准交叉熵微调的两倍。