论文

CapFrame:用几何伪标签按文字指令定位三维高斯场景视点

CapFrame: Text-Instructed Viewpoint Grounding in 3D Gaussian Scenes via Geometric Pseudo Labels

应用与实践视觉感知与空间理解

摘要

3D 高斯溅射 (3DGS) 可以实现逼真的实时新颖视图合成,但放置虚拟相机来捕获所需的帧仍然主要是手动的。 3D 场景中现有的语言引导方法主要侧重于以对象为中心的基础,确定要观察的内容,但很少控制它在单个帧中的显示方式,例如主题方向或帧布局。为了解决这个限制,我们引入了一项新任务,文本指令视点定位(TIVG),其目的是识别 3D 高斯场景中的 6-DoF 相机位姿,其渲染帧与文本指令对齐。为了解决这个任务,我们提出了 CapFrame,这是一个部分可微的框架,可将语言转换为几何伪标签以进行相机姿态优化。 CapFrame 遵循检索-翻译-细化流程:它检索相关视图并通过 MLLM 的问题评估流程对它们进行排名,将指令转换为方向和布局伪标签,并通过 3DGS 中布局和方向损失的可微优化来细化相机位姿。对 38 个真实世界场景和 135 条指令进行的实验表明,与启发式视点搜索和自适应轨迹生成基线相比,CapFrame 生成的视点与文本更好地一致,并经过 VLM 指标、MLLM 评委和用户研究的验证。代码位于:https://github.com/jirongli/CapFrame