论文

扩散变压器被证明是最佳的上下文生成器

Diffusion Transformers are Provably Optimal In-context Generators

模型评测模型行为与机制分析

摘要

生成基础模型因其能够从推理时给出的演示产生所需输出而无需更新参数而引起人们的兴趣。然而,由于一些演示无法唯一地识别预期任务,因此面临的挑战是如何从反映该任务不确定性的输出分布中学习和采样。在这项工作中,我们从理论上分析了跨不同任务进行预训练的扩散变压器(DiT)如何从演示中学习并生成新查询的预测分布。我们首先表明,从有限演示生成的自然目标不是从估计单个任务得出的输出,而是捕获观察演示后剩余的任务不确定性的预测分布。然后,我们证明 DiT 可以通过分数估计来学习这种预测分布,利用注意力来聚合来自演示和扩散的信息以生成样本。由于这一特性,通过足够的预训练资源和扩散采样步骤,生成的 DiT 在 Hölder 类测试时任务上实现了极小极大最优速率。这些结果意味着 DiT 作为一个基于统计的上下文生成器,能够生成适应新任务的分布,同时保留有限演示中固有的不确定性。

扩散变压器被证明是最佳的上下文生成器的原论文方法或结果图
图 5:定性后验预测生成。上半部分显示带有圆形查询的任务,下半部分显示带有三角形查询的任务;每个任务都显示在 $n=1$ 和 $n=8$ 处。从左到右,每行包含可用的上下文输入输出对 $X_{i}\to Y_{i}$、未转换的查询输入、该查询的四个独立代以及 $256$ 代的像素平均值。所有样本均使用原始模型权重。对于圆任务,精确/生成的右模式概率在 $n=1$ 处为 $0.550/0.562$,在 $n=8$ 处为 $0.999/0.965$。对于其他任务,它们是 $n=1$ 处的 $0.527/0.410$ 和 $n=8$ 处的 $0.009/0.055$。 $n=1$ 的水平模糊平均值反映了双峰性,而 $n=8$ 的清晰平均值反映了后预测收缩。