论文
生成模型中奖励对齐的无梯度噪声优化
Gradient-Free Noise Optimization for Reward Alignment in Generative Models
摘要
现有的扩散和流动模型奖励对齐方法依赖于多步随机轨迹,这使得它们难以扩展到确定性生成器。一个自然的替代方案是噪声空间优化,但现有方法需要通过生成器和奖励管道进行反向传播,限制了对可微分设置的适用性。为了解决这个问题,我们在这里提出了 ZeNO(零阶噪声优化),这是一种无梯度框架,它将噪声优化表述为路径积分控制问题,可仅根据零阶奖励评估进行估计。当用 Ornstein-Uhlenbeck 参考过程实例化时,更新连接到隐式针对奖励倾斜分布的 Langevin 动力学。 ZeNO 能够实现有效的推理时间缩放,并在不同的生成器和奖励函数中表现出强大的性能,包括反向传播不可行的蛋白质结构生成任务。