论文

LottieGPT:为自回归生成标记化矢量动画

LottieGPT: Tokenizing Vector Animation for Autoregressive Generation

应用与实践内容创作

摘要

尽管视频生成技术取得了快速进展,但现有模型无法生成矢量动画,而矢量动画是互联网上占主导地位且具有高度表现力的多媒体形式。矢量动画提供分辨率无关、紧凑性、语义结构和可编辑的参数化运动表示,但当前的生成模型仅在光栅空间中运行,因此无法合成它们。与此同时,大型多模态模型的最新进展展示了生成幻灯片、3D 网格、乐高序列和室内布局等结构化数据的强大能力,这表明原生矢量动画生成是可以实现的。在这项工作中,我们提出了第一个用于标记化和自回归生成矢量动画的框架。我们采用 Lottie(一种广泛部署的基于 JSON 的动画标准),并设计了一个定制的 Lottie Tokenizer,它将分层几何图元、变换和基于关键帧的运动编码为紧凑且语义对齐的标记序列。为了支持大规模训练,我们还构建了 LottieAnimation-660K,这是迄今为止最大、最多样化的矢量动画数据集,由 660k 个真实世界的 Lottie 动画和来自广泛互联网资源的 1500 万个静态 Lottie 图像文件组成。在这些组件的基础上,我们对 Qwen-VL 进行了微调,创建了 LottieGPT,这是一种原生多模态模型,能够直接从自然语言或视觉提示生成连贯、可编辑的矢量动画。实验表明,我们的分词器极大地减少了序列长度,同时保留了结构保真度,从而实现了动态向量内容的有效自回归学习。 LottieGPT 在不同的动画风格中表现出强大的泛化能力,并且在 SVG 生成(单帧矢量动画的特殊情况)方面优于先前最先进的模型。