论文
BioVid:具有生物行为语义理解的自回归视频生成
BioVid: Autoregressive Video Generation with Biological Behavior Semantic Comprehension
摘要
生物行为的视频生成需要的不仅仅是视觉上合理的运动:动作的持续时间本身就是一种语义属性。现有的模型通常依赖于固定的时间窗口、外部延续或提示驱动的故事,因此长度是外部指定的,而不是从行为中学习的。为了解决这一差距,我们提出了 BioVid,一种数据驱动的自回归框架,用于生成自适应长度的生物行为。 BioVid 使用 2D 编码/3D 解码标记器:二维 FSQ-R3GAN 编码器将每个帧转换为离散视觉标记,保留适合下一个标记预测和基于 EOS 的终止的单帧信息,而时间膨胀和视频微调的三维解码器则使用时间上下文重建生成的标记,以减少闪烁。然后,因果 Transformer 对逐帧词元序列进行建模,并且仅以第一帧为条件,在发出序列结束词元时停止生成,从而允许从学习的行为分布中出现持续时间。我们对 NTU RGB+D 的 A001 饮用行为评估 BioVid。在 94 个保留剪辑上,BioVid 与真实持续时间分布的 Wasserstein-1 距离为 1.24 帧。相比之下,即使配置为最接近数据集平均值的可用长度,固定长度基线也会产生大约 6-7 帧的距离,而当使用传统的 16 帧生成长度时,产生大约 15 帧的距离。这些结果证明了 BioVid 学习和重现生物行为的内在持续时间分布的能力。