论文
Chat-Edit-3D++:通过 大语言模型 进行交互式 3D 和 4D 场景编辑
Chat-Edit-3D++: Interactive 3D and 4D Scene Editing via Large Language Models
摘要
最近基于视觉语言 预训练 模型的图像内容操作工作已有效扩展到文本驱动的 3D 场景编辑。然而,现有的3D场景编辑方案仍然存在一定的缺陷,阻碍了它们作为交互设计工具的进一步发展。此类方案通常遵循固定的输入模式,限制了文本输入的灵活性。此外,它们的编辑能力受到单个或几个 2D 视觉模型的限制,并且需要复杂的管道设计才能将这些模型集成到 3D 重建过程中。为了解决上述问题,我们提出了 Hash-Atlas 网络,它将 3D 场景编辑重新表述为对 2D 图集图像的操作,从而实现 2D 编辑和 3D 重建过程的工作流程解耦。在此基础上,我们引入了一种基于对话的3D场景编辑方法,称为CE3D++,它以大语言模型(LLM)为中心,允许用户任意文本输入并解释他们的意图,随后促进相应视觉模型的自主调用。此外,我们通过对移动物体施加运动约束将CE3D++扩展到单目4D场景,并通过创建与编辑任务相关的轨迹数据集进一步将微调扩展到LLM,这使得较小的LLM能够准确地调度多达30种不同的视觉工具。实验结果表明,CE3D++有效集成多种视觉模型,实现多样化的视觉编辑效果,具有强大的场景理解能力和多轮对话能力。源代码和训练模型可在 https://github.com/Fangkang515/CE3D 获取。