论文

Transformer 作为上下文采样器:从闭式扩散到无估计采样

Transformers as In-Context Samplers: From Closed-Form Diffusion to Estimation-Free Sampling

模型评测模型行为与机制分析

摘要

越来越多的工作表明,大语言模型 不仅仅是统计存储器,而且能够进行上下文学习:仅使用提示中提供的示例在测试时执行推理,无需任何参数更新。先前的理论工作表明,这种能力可以扩展到监督学习任务,例如线性回归。我们证明上下文学习进一步扩展到\emph{数据生成}:冻结的 Transformer 可以模拟来自上下文样本的迭代生成采样器。我们首先证明 Transformer 可以实现封闭式和平滑封闭式扩散采样器。该结构确定了 softmax 注意力的具体生成作用:它计算责任权重和加权经验平均值,而前馈层实现欧拉更新。为了凭经验将这些结构与预训练的语言模型联系起来,我们研究了 \emph{语义主题采样}:由来自常见语义类别(例如动物、食物或城市)的单词组成的提示。在 Transformer 层中,归一化的隐藏状态呈现出两阶段的几何形状:它们在中间层中向均匀的球形参考移动,然后返回到输出附近的结构化、主题相关的表示。我们进一步测量这些隐藏状态云上的相互作用粒子能量,并观察到相同的 U 形图案。然后我们证明 Transformer 可以近似基于能量的采样器,跨层构建相同的 U 形能量。