论文
VAnim:用于保持结构的矢量动画的渲染感知稀疏状态建模
VAnim: Rendering-Aware Sparse State Modeling for Structure-Preserving Vector Animation
摘要
可扩展矢量图形 (SVG) 动画生成因其结构可编辑性和分辨率独立性而对于专业设计至关重要。然而,这项任务仍然具有挑战性,因为它需要将离散代码表示与连续视觉动态联系起来。现有的基于优化的方法经常破坏拓扑一致性,而通用的 LLM 依赖于刚性 CSS/SMIL 变换,无法对几何级非刚性变形进行建模。为了解决这些限制,我们推出了 VAnim,这是第一个基于 LLM 的开放域文本到 SVG 动画框架。我们将动画重新概念化为持久 SVG DOM 树上的稀疏状态更新 (SSU),而不是序列生成。该范例将序列长度压缩超过 9.8 倍,同时通过构造保留 SVG DOM 结构和非参与元素。为了实现精确控制,我们提出了一种识别优先的运动规划机制,该机制将文本指令建立在显式视觉实体中。此外,为了克服 SVG 渲染的不可微分性质,我们通过组相对策略优化 (GRPO) 采用渲染感知强化学习。通过利用最先进的视频感知编码器的混合奖励,我们将离散代码更新与高保真视觉反馈结合起来。我们还介绍了 SVGAnim-134k,这是矢量动画的第一个基准。大量实验表明,VAnim 在语义对齐和结构有效性方面显着优于最先进的基线,附加的附录指标进一步验证了运动质量和身份保留。