论文

iARCS:可控三维场景生成的迭代Agentic强化学习

iARCS: Iterative Agentic RL for Controllable 3D Scene Generation

模型训练强化学习Agentic RL

摘要

合成三维场景生成正日益成为计算机视觉和体感人工智能的数据来源,但现有的生成器往往在优化感知真实性的同时未能可靠地满足任务关键性功能约束。这种不匹配限制了合成数据在下游训练中的实用性,其中可访问性、可达性和空间规则遵从性往往是必要的。我们提出iARCS(Iterative Agentic Reinforcement Learning for Scene Constraints),这是一种迭代的主动强化学习框架,它使预训练的场景生成器适应自然语言任务要求。iARCS采用两阶段策略:首先进行通用奖励预训练以提高物理合理性与布局质量,然后通过LLM生成的任务特定微调,该过程是基于反馈不断优化的。实验结果表明,在行走性、可达性和高度限制等任务上提高了约束一致性,有效实现了任务特定的约束优化,并且生成的数据具有竞争力的多样性。此外,我们还展示了iARCS生成的数据能够提升基础生成器的表现,从而使其成为实用合成数据生成工具而非仅是可控场景编辑方法的实际价值。

iARCS:可控三维场景生成的迭代Agentic强化学习:论文配图
图 3:iARCS 概述:具有扩散 RL 和反射的代理奖励合成。根据用户提示,LLM 代理执行 (1) 推理、(2) 约束分解和 (3) 可执行奖励计划生成。生成的任务奖励与通用奖励相结合,形成复合目标,并通过扩散 RL 循环中的 DDPO 进行优化,以微调预训练的场景生成器。奖励反射模块监控生成场景的奖励统计数据,修改奖励代码/权重,并将更新反馈给代理,从而实现约束满足的迭代改进,同时保留场景的真实性和多样性。