论文

3DrawAgent:通过早期对比经验教 LLM 进行 3D 绘图

3DrawAgent: Teaching LLM to Draw in 3D with Early Contrastive Experience

应用与实践内容创作

摘要

3D 空间中的草图可以对形状、结构和空间关系进行表达性推理,但通过自然语言生成 3D 草图仍然是一项重大挑战。在这项工作中,我们介绍了 3DrawAgent,这是一种用于 3D 草图生成的 无需训练 语言驱动框架,它利用 大语言模型 (LLM) 在几何反馈下顺序绘制 3D 贝塞尔曲线。与之前的 2D 草图代理不同,我们的方法引入了相对经验优化策略,该策略适应最近提出的群体奖励策略优化(GRPO)范式。我们不依赖明确的 真值 监督,而是在生成的草图之间构建成对比较,每对都包含基于基于 CLIP 的感知奖励和基于 LLM 的细粒度定性评估的相对更好和更差的结果。然后,这些经验被用来迭代完善 3D 绘图的先验知识,从而实现模型 3D 意识的黑盒强化。这种设计使我们的模型能够自我提高其空间理解和绘图质量,而无需更新参数。实验表明,3DrawAgent 可以根据不同的文本提示生成复杂且连贯的 3D 贝塞尔草图,展示紧急几何推理,并推广到新颖的形状,为推进 无需训练 3D 草图智能领域建立了新的范例。