论文

生成野生动物:个体一致的野生动物图像到视频生成

Generating the Wild: Individual-Consistent Image-to-Video Generation for Wildlife

应用与实践内容创作

摘要

个体层面的野生动物识别常常面临数据匮乏的问题,因为对同一动物在不同姿势、视角和动作下的不同观察很少可用。图像到视频(I2V)生成提供了一种有前途的方法,通过合成来自单个参考图像的额外观察结果来缓解这一限制。然而,现有的 I2V 模型主要强调全局布局、语义和运动,因此常常无法保留区分一个野生动物个体与另一个野生动物个体的细粒度局部外观线索,例如皮毛纹理、条纹边界、斑点配置和轮廓过渡。我们观察到这些身份关键线索与高频信息密切相关。为了应对这一挑战,我们提出了 WildIcon,这是一种用于野生动物个体一致性的高频引导 I2V 框架。具体来说,WildIcon 引入了一个频率感知身份编码分支,可以从参考图像中提取特定于个人的高频线索。与孤立的前景信息相结合,得到的身份token然后被注入到交叉注意块中作为身份调节。 WildIcon 建立在具有轻量级身份适应的冻结骨干模型之上,保留了参考图像中可见的细粒度身份线索,同时保留了基本 I2V 模型的运动可控性和语义保真度。此外,为了支持训练和野生动物个体一致的 I2V 评估,我们构建了 WildlifeVid,这是一个以野生动物为中心的视频数据集,具有高质量、时间连贯的剪辑和个体级别的身份标签。 I2V 生成和下游动物重新识别 (ReID) 的实验表明,WildIcon 比现有基线实现了更强的个体一致性,并且其过滤输出可以作为下游 ReID 的有用候选训练增强。

生成野生动物:个体一致的野生动物图像到视频生成的原论文方法或结果图
图 2:WildlifeVid 概览统计数据。 (a) 四个公共数据源中 WildlifeVid 的组成,显示每个源中的视频数量、身份和物种。 (b) 视频时长的分布。 (c) 按视频数量排名的物种分布以及累积覆盖范围。