论文

SceneForge:通过 3D 干预进行结构化世界监督

SceneForge: Structured World Supervision from 3D Interventions

模型训练合成数据

摘要

许多多模式学习任务需要在编辑、观点和场景级干预之间保持一致的监督。然而,这种监督很难从观察级数据集中获得,因为观察级数据集不会暴露底层场景状态或变化如何通过它传播。我们提出了 SceneForge,一个干预驱动的框架,可以从可编辑的 3D 世界状态生成结构化监督。 SceneForge 将每个场景表示为一个具有语义、几何和物理依赖性的持久世界。通过应用显式干预(例如,对象移除或摄像机变化)并通过场景依赖性传播其效果,SceneForge 渲染的监督与对象结构和场景级效果保持一致。这会产生一致的输出,包括反事实观察、多视图观察和效果感知信号(例如阴影和反射),所有这些都源自共享的世界状态,而不是事后图像空间处理。我们使用 Infinigen 和 Blender 实例化 SceneForge,构建一个许可干净的室内监督资源,其中包含来自超过 2K 场景的大量反事实对和对齐注释,涵盖不同的单视图和注册的多视图设置。在匹配的训练预算下,结合 SceneForge 监督可以提高定量和定性评估中多个基准的对象去除和场景去除性能。这些结果表明,将监督建模为可编辑世界中的结构化状态转换,为干预一致的多模态学习提供了实用且可扩展的基础。