论文
扩散变压器被证明是最佳的上下文生成器
Diffusion Transformers are Provably Optimal In-context Generators
摘要
生成基础模型因其能够从推理时给出的演示产生所需输出而无需更新参数而引起人们的兴趣。然而,由于一些演示无法唯一地识别预期任务,因此面临的挑战是如何从反映该任务不确定性的输出分布中学习和采样。在这项工作中,我们从理论上分析了跨不同任务进行预训练的扩散变压器(DiT)如何从演示中学习并生成新查询的预测分布。我们首先表明,从有限演示生成的自然目标不是从估计单个任务得出的输出,而是捕获观察演示后剩余的任务不确定性的预测分布。然后,我们证明 DiT 可以通过分数估计来学习这种预测分布,利用注意力来聚合来自演示和扩散的信息以生成样本。由于这一特性,通过足够的预训练资源和扩散采样步骤,生成的 DiT 在 Hölder 类测试时任务上实现了极小极大最优速率。这些结果意味着 DiT 作为一个基于统计的上下文生成器,能够生成适应新任务的分布,同时保留有限演示中固有的不确定性。
