论文
ViSculpt:以视觉为中心的代理几何编辑
ViSculpt: Visual-Centric Agentic Geometry Editing
摘要
3D 几何编辑是图形管道中关键且劳动密集型的部分,要求艺术家将创意意图转化为复杂专业软件中的精确操作。 大语言模型 (LLM) 已显示出基于脚本的 3D 创建的前景,但脚本生成不太适合任意现有网格的感知驱动编辑,其中执行必须保持视觉基础,并且应保留未触及的区域。我们提出了一个 \emph{以视觉为中心}的 无需训练 多代理系统,该系统通过模拟人类艺术家的迭代工作流程,直接在 Blender 中编辑现有的 3D 网格。我们的系统不是生成脚本或重新生成几何体,而是通过 Blender GUI 进行操作:多模式 LLM 代理观察视口,推断当前网格状态,并通过模拟用户交互执行本地化编辑。在策划的基准上进行的实验提供了初步证据,表明这种代理方法可以遵循自然语言指令,执行代表性的本地化网格编辑,并保留输入资产的整体身份。我们的结果强调了语言驱动的 3D 编辑的补充机制:在本机 3D 编辑工作流程中直接就地修改现有网格。我们认为这项工作是专业图形软件中以视觉为中心的代理几何编辑的探索性一步。