论文
Flow3D-OPD:多教师 同策略 蒸馏,用于通过流量匹配扩散生成 3D 几何图形 Transformer
Flow3D-OPD: Multi-Teacher On-Policy Distillation for 3D Geometry Generation with Flow-Matching Diffusion Transformer
摘要
最近基于流匹配扩散 Transformer (DiT) 构建的图像到 3D 生成模型可以生成高保真度网格,但其 后训练 策略在很大程度上仍未被探索。强化学习存在几个关键瓶颈:定义3D几何质量综合奖励的固有困难,以及联合优化异构目标时出现的梯度干扰。受到 同策略 蒸馏 (OPD) 在 大语言模型 和图像生成中的实用性的启发,我们提出了 \textbf{Flow3D-OPD},一个两阶段的 后训练 框架,它将多教师 蒸馏 引入 3D 几何生成。在第一阶段,我们利用半策略来增强预训练模型的基础能力,然后设计用于3D几何质量评估的代理验证器。基于验证器,我们可以通过直接偏好优化(DPO)来培养特定领域的教师模型。在第二阶段,我们通过 同策略 蒸馏 将异构专业知识整合为统一的学生模型,具有硬任务路由采样和梯度累积,这可以减轻联合优化中的梯度干扰。在不依赖精心修改的情况下,我们简单而有效的设计在所有几何质量维度上实现了一致的改进,并在平均指标上超越了所有教师模型。大量实验表明,我们的方法为 3D 生成中的强化学习提供了有效的范例。