论文

Transformer是否会按任务难度调整所用深度?

Do Transformers Use their Depth Adaptively? Evidence from a Relational Reasoning Task

模型评测模型行为与机制分析

摘要

我们研究 Transformer 是否在难度不断增加的任务中自适应地使用其深度。使用基于家庭故事的受控多跳关系推理任务,其中难度由必须组成的关系跳跃的数量决定,我们监控(i)预测如何通过早期读出(logits 镜头)跨层演变,以及(ii)如何通过因果修补跨词元集成任务相关信息。对于预训练模型,我们发现了一些关于自适应深度使用的有限证据:一些较大的模型需要更少的层来获得更简单的任务的合理答案,并且随着链长度的增加,模型通常使用更多的层来集成跨词元的信息。对于针对任务进行微调的模型,我们发现了自适应深度使用的更清晰、更一致的证据,对于不保留一般语言建模能力的约束较少的微调机制,效果更强。