论文
Hallo4D:多模态幻觉缓解,实现一致的时空生成
Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation
摘要
虽然 3D 生成领域的最新进展已经实现了令人印象深刻的视觉合成,但现有方法通常依赖于 2D 扩散监督,而没有明确的几何一致性机制,从而导致空间幻觉,例如重复的结构和未对齐的几何形状。这些问题在 4D 生成中变得更加严重,其中保持视点和时间演化的一致性会带来额外的挑战,包括抖动、身份闪烁和结构漂移。我们提出了 \textbf{Hallo4D},一个与模型无关的统一框架,用于减轻 3D 和 4D 内容生成中的时空幻觉。 Hallo4D 引入了一种生成-检测-校正范例,利用大型多模态语言模型 (LMM) 来识别和总结多视图和多帧渲染中的空间和时间不一致。这些见解指导共识驱动的图像空间一致性优化,其中基于 LMM 的选择器通过多模型投票评估候选校正,而不需要重新训练或架构修改。为了进一步提高时间一致性和优化效率,Hallo4D 结合了运动感知关键帧采样、LMM 引导初始化和外观对齐。我们还引入了曝光感知优化和可见性修剪,以增强在具有挑战性的观点下的鲁棒性。大量实验表明,Hallo4D 在不同的 3D 和 4D 生成设置中始终优于强大的基线,为一致性感知内容生成提供了可扩展且通用的解决方案。