论文

通过动态归位优化进行 3D 网格生成的流匹配强化

Flow Matching Reinforcement for 3D Mesh Generation via Dynamic Homing Optimization

模型训练强化学习

摘要

流匹配是 3D 生成的核心,但在实践中,其强化学习 (RL) 方法很大程度上改编自 2D 视觉生成。代表性的 DPO、GRPO 和 NFT 型目标在应用于负轨迹时,主要使预测速度远离相应方向,而无需明确指定朝向首选样本的目标速度场。在 3D 生成中,受预训练模型功能、rollout多样性和奖励分配复杂性的限制,直接应用这些 RL 方法在几何质量方面的收益有限。我们引入了一种前向过程 RL 方法 Dynamic Homing Optimization (DHO),它将负轨迹优化重新表述为正样本吸引引导的动态归航。具体来说,最小成本有吸引力匹配 (MAM) 为每个负样本分配一个不同的正目标,然后时间感知动态校正 (TDC) 使用剩余时间感知校正速度将其轨迹重定向到目标。基于异步在线 DHO,我们开发了 Flow3D-Pro,一种图像到 3D 几何生成框架。实验表明,DHO 在 3D 生成方面优于代表性的 DPO、GRPO 和 NFT 式目标,而 Flow3D-Pro 可以生成比现有网格生成方法更高质量的 3D 几何体。