论文
用于生成场景中人物的多视图图像的评估框架
An Evaluation Framework for Generating Multi-View Images of a Person in a Scene
摘要
最近的生成图像编辑 Diffusion Transformer (DiTs) 展示了令人印象深刻的语义编辑功能,但仍然难以实现空间一致的相机角度变化。训练基础模型执行自由形式、及时的摄像机角度变化的主要瓶颈是缺乏专门的训练数据。虽然通用 3D 环境和对象存在多视图数据集,但仍然缺乏以自然场景中固定位置的人类主体为特征的配对多视图数据集,包括正面和侧面视图。在不受约束的环境中捕获此类多摄像头数据在逻辑上具有挑战性且无法扩展。在本文中,我们首先尝试使用多种最先进的图像编辑模型来综合创建这些数据,但发现输出经常容易产生幻觉,涉及主体的头部相对于背景转动了多少,通常会产生不一致的环境。为了解决这个问题,我们提出了头部场景旋转差异(HSRD)指标来定量评估人周围的相机运动。所提出的指标通过将相机运动与局部头部姿势操纵解耦来进行操作。正如广泛的实验所证明的那样,HSRD 提供了评估场景中人的 3D 空间视差所需的管道,为可靠地构建高质量多视图合成数据集铺平了道路。