论文
HOMIE:通过多模态智能增强以人为中心的视频个性化
HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enhancement
摘要
以人为中心的视频个性化 (HOCVP) 是主题驱动视频生成中的核心任务。然而,现有方法存在两个关键限制。首先,大多数关注主体间个性化的方法仍然难以在高主体保真度和人类与不同物体之间的准确交互模式之间取得平衡,特别是当物体代表徽标等抽象概念时。其次,虽然主题内参考(例如 OCR 地图、多视图输入)有望提高主题保真度,但大多数现有作品缺乏理解这种潜在对应关系的机制。为了应对这两个挑战,我们提出了 HOMIE,这是一个 HOCVP 框架,它以统一的方式处理主体间和主体内的输入设置。与以前的方法相比,HOMIE 提出了一种更好的 MLLM 集成策略,可以提取参考级关系的知识,而不会影响文本编码器的可控性或产生昂贵的重新对齐。具体来说,我们在自注意力中引入全局多模态指导,以更好地将 MLLM 派生的语义特征与 VAE 词元结合起来。此外,我们提出模态参考嵌入来区分标记与 MLLM 特征和 VAE 标记,并关联主体内参考图像标记。大量实验验证了我们的方法在各种 HOCVP 任务中实现了最先进的性能。项目页面:https://yiyangcai.github.io/homie-page.github.io/