论文

VGGT-Edit:具有残差场预测的前馈原生 3D 场景编辑

VGGT-Edit: Feed-forward Native 3D Scene Editing with Residual Field Prediction

应用与实践内容创作

摘要

高质量 3D 场景重建最近已向通用前馈架构发展,从而能够在单次前向传递中生成复杂的环境。然而,尽管它们在静态场景感知方面表现出色,但这些模型在响应动态人类指令方面仍然有限,这限制了它们在交互式应用中的使用。现有的编辑方法通常依赖于 2D 提升策略,其中单独的视图被独立编辑,然后提升回 3D 空间。这种间接管道通常会导致纹理模糊和几何图形不一致,因为 2D 编辑器缺乏保留跨视点结构所需的空间意识。为了解决这些限制,我们提出了 VGGT-Edit,这是一种用于文本条件原生 3D 场景编辑的前馈框架。 VGGT-Edit 引入了深度同步文本注入,使语义指导与主干的空间姿势保持一致,确保稳定的指令基础。然后,该语义信号由残差变换头处理,该变换头直接预测 3D 几何位移以使场景变形,同时保持背景稳定性。为了确保高保真结果,我们使用多项目标函数来监督框架,以增强几何精度和跨视图一致性。我们还构建了 DeltaScene 数据集,这是一个通过具有 3D 协议过滤的自动化管道生成的大规模数据集,以确保 真值 质量。实验表明,VGGT-Edit 的性能明显优于 2D 提升基线,可产生更清晰的对象细节、更强的多视图一致性和近乎即时的推理速度。项目页面为https://chriszkxxx.github.io/VGGT-Edit/。