论文

搞什么?!使用 Wasserstein 倾斜流程图进行免模拟强化学习

WTF?! Simulation-Free Reinforcement Learning with Wasserstein-Tilted Flow Maps

模型训练强化学习

摘要

奖励微调旨在更新预训练的基于流的生成模型,以提高其生成样本的下游奖励。现有方法通常将这个问题表述为从奖励倾斜分布中采样,这是 KL 正则化奖励最大化问题的解决方案。在这里,我们介绍了直接根据预训练漂移构建的最佳传输正则化器。与 KL 奖励倾斜不同,由此产生的目标将个体样本转移到更高的奖励,而不是重新加权基础分布。我们表明,由此产生的问题相当于流量上的确定性最优控制问题。给定预先训练的流图,这种等价性产生了一种无需模拟的强化学习算法,用于微调生成流。我们将由此产生的框架称为 Wasserstein-Tilted Flow Maps (WTF),这是流图原生的第一个端到端微调方法。输出是一个经过微调的流程图,它在几步推理预算下保留了强大的奖励对齐性能,而无需事后蒸馏。 ImageNet-256 和文本到图像的实验表明,WTF 获得了更高的奖励,具有与基线相当或更高的多样性,同时需要的训练计算量减少了 280 倍。更广泛地说,我们认为流图等加速采样器是高效训练后的重要基础设施,而占主导地位的 KL 正则化公式只是值得重新审视的众多选择之一。