论文

Transformer过早停止思考,微型 LoRA 解决了这个问题

Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It

模型训练参数高效训练

摘要

预训练的 Transformer 很少使用其深度来遵循上下文中的参考文献。 13 个基本模型仅可靠地遵循 1.4-3.6 行,额外的预训练循环几乎没有增加。在早期一层经过任务训练的 8 级 LoRA 通过冻结所有模型权重来扩展此计算。 Qwen3-8B 在 24 线链上的精确度从 15.5% 提高到 99%;训练时间较长的 LoRA 可以达到 50 行。 Ouro-1.4B 在四次循环后达到 60 行,在八次循环后至少达到 160 行。 LoRA 启动中继:程序线通过短范围的中间层传递其链身份。冻结的头脑会逐渐向链条的上游延伸,而消除家长的注意力就会停止传递。冻结模型测量将最后一个有用的干预层定位在四个保留模型中的三个的公差范围内。特定任务的 LoRA 也改进了 MuSiQue。因此,默认答案低估了通过微小编辑即可访问的计算。代码和交互式演示可在 https://lunamos.github.io/stop-thinking-too-early/ 获取