论文

离散流匹配策略优化

Discrete Flow Matching Policy Optimization

模型训练强化学习

摘要

我们引入了离散流匹配策略优化 (DoMinO),它是在广泛的策略梯度方法下强化学习 (RL) 微调 离散流匹配 (DFM) 模型的统一框架。我们的关键思想是将 DFM 抽样过程视为多步骤马尔可夫决策过程。这种观点提供了将 微调 奖励最大化简单而透明地重新表述为稳健的 RL 目标。因此,它不仅保留了原始的 DFM 采样器,而且还避免了许多先前的 RL 微调 方法使用的有偏差的辅助估计器和似然代理。为了防止策略崩溃,我们还引入了新的总变异正则化器,以保持微调后的分布接近预训练的分布。理论上,我们建立了 DoMinO 离散化误差的上限和正则化器的易处理上限。通过实验,我们评估了 DoMinO 的调控 DNA 序列设计。与之前的最佳奖励驱动基线相比,DoMinO 实现了更强的预测增强子活性和更好的序列自然度。正则化进一步改善了与自然序列分布的对齐,同时保留了强大的功能性能。这些结果将 DoMinO 确立为可控离散序列生成的有用框架。