论文

HAT-4D:通过人机协作提升单目视频以实现 4D 多对象交互

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

应用与实践视觉感知与空间理解

摘要

从大量野外单目视频中提取动态 4D 对象交互,为扩展 Embodied AI 和训练 VLA 提供了高效的数据收集途径。然而,现有的单目 4D 重建方法主要关注孤立的对象,在多对象交互中固有的严重遮挡和复杂动态下往往会失败。为了弥补这一差距,我们提出了 HAT-4D,这是第一个代理框架,旨在从单个视频中重建多个对象的 3D 几何、时间动态和物理交互。通过将 VLM 与多级人机交互反馈机制相集成,HAT-4D 可以有效解决 3D 生成和 4D 传播过程中的深度模糊性和交互引起的遮挡,从而在不依赖昂贵的多摄像头设备的情况下生成物理上合理的资产。作为可扩展的数据引擎,HAT-4D 促进了 MVOIK-4D 的创建,MVOIK-4D 是单目 4D 交互重建的开放世界基准,并配有专注于物理合理性和时间一致性的新型多维评估协议。大量实验表明,HAT-4D 在大多数评估指标上都实现了 SOTA 性能,同时保持了有竞争力的语义对齐。消融研究表明,引入少量的人类反馈可以改善交互重建。此外,HAT-4D 生成的数据用于 微调 时可有效提高基线性能。我们的数据和代码可以在 https://lijiaxin0111.github.io/HAT4D/ 获取