论文
Transformer 通过镜像下降在上下文中学习潜在混合模型
Transformers Learn Latent Mixture Models In-Context via Mirror Descent
摘要
序列建模需要确定哪些过去的标记与上下文及其重要性具有因果关系:Transformer 中注意力层固有的过程,但其底层学习机制仍然知之甚少。在这项工作中,我们通过引入基于转换分布混合的框架,将估计词元重要性的任务形式化为上下文学习问题,其中潜在变量决定了过去词元对下一个词元的影响。该潜在变量的分布由 Transformer 必须在上下文中学习的未观察到的混合权重参数化。我们证明 Transformer 可以实现镜像下降来从上下文中学习这些权重。具体来说,我们给出了三层 Transformer 的显式构造,它精确地实现了镜像下降的一步,并证明所得估计器是贝叶斯最优预测器的一阶近似。通过梯度下降证实了我们的构造及其可学习性,我们凭经验表明,从头开始训练的 Transformer 学习与我们的理论一致的解决方案:它们的预测分布、注意力模式和学习的转换矩阵与构造紧密匹配,而更深的模型实现了与多步镜像下降相当的性能。