论文
AniMatrix:一种从艺术而非物理角度思考的动漫视频生成模型
AniMatrix: An Anime Video Generation Model that Thinks in Art, Not Physics
摘要
视频生成模型将物理现实主义作为其优先考虑。动漫故意违反物理:涂抹、冲击帧、赤壁变速;其数千种共存的艺术惯例产生了模型无法吸收的单一“动画物理学”。因此,偏向物理的模型使定义媒介的艺术性变得扁平化,或者在其风格差异下崩溃。我们提出了 AniMatrix,一种视频生成模型,通过双通道调节机制和三步过渡,以艺术正确性而非物理正确性为目标:重新定义正确性、超越物理先验、区分艺术与失败。首先,制作知识系统将动画编码为可控制作变量(风格、运动、摄像机、视觉特效)的结构化分类法,AniCaption 从像素中推断出这些变量作为导演指令。可训练的标签编码器保留了该分类的字段值结构,而冻结的 T5 编码器则处理自由形式的叙述;双路径注入(用于细粒度控制的交叉注意力,用于全局执行的 AdaLN 调制)确保分类指令永远不会被开放式文本稀释。其次,风格-动作-变形课程将模型从近乎物理的运动转变为完整的动漫表现力。第三,具有特定领域奖励模型的变形感知偏好优化将有意的艺术性与病态的崩溃区分开来。在由专业动画师对五个制作维度进行的动画特定人类评估中,AniMatrix 在五个维度中的四个维度中排名第一,在即时理解(+0.70,+22.4%)和艺术运动(+0.55,+16.9%)方面比 Seedance-Pro 1.0 进步最大。我们正在准备公开发布的配套资源,以支持可重复性和后续研究。