论文
直接、并行还是顺序? 无需训练多主体图像到视频生成的比较研究
Direct, Parallel, or Sequential? A Comparative Study of Training-Free Multi-Subject Image-to-Video Generation
摘要
文本条件图像到视频 (I2V) 的生成技术发展迅速,但生成多个主题的视频仍然具有挑战性。模型必须同时保留每个主体的外观,分配不同的运动,并保持连贯的空间和时间交互。本文对 无需训练 多主体 I2V 生成的三种代表性范式进行了系统研究:直接生成、并行生成和顺序生成。直接生成将预训练的 I2V 模型应用于完整的参考图像和提示,要求联合合成所有主题和运动。相反,并行和顺序生成将参考图像和提示分解为特定于主题的视觉和文本条件。并行生成独立地合成每个主题,然后组合生成的视频,以较弱的主题间上下文为代价降低每个生成步骤的复杂性。顺序生成首先合成背景视频,然后逐步引入各个主题。这保留了累积的场景上下文,但引入了对主题排序和错误传播的敏感性。我们根据经验评估了不同多主体场景中的三种范式,比较了外观保留、运动保真度、时间一致性和主体间连贯性,同时还描述了它们独特的故障模式。我们的研究结果揭示了每种范式的优点和局限性,并为设计可控多主体视频生成系统提供了实用的见解。