论文

SARA:视频扩散模型的语义自适应关系对齐

SARA: Semantically Adaptive Relational Alignment for Video Diffusion Models

摘要

最近的视频扩散模型(VDM)合成了视觉上令人信服的剪辑,但仍然会丢弃实体、错误绑定属性并削弱提示中指定的交互。 VideoREPA 和 MoAlign 等表示对齐目标通过从冻结的视觉基础模型中提取时空标记关系来改进细粒度文本跟踪,但它们的成对监督预算是根据视觉或运动线索分配的,而不是根据每对与提示的相关程度来分配的。我们提出 SARA,语义自适应关系对齐,它将词元关系 蒸馏 (TRD) 保留在冻结的 VFM 目标上,并添加文本条件显着性来决定哪些词元对进行监督。轻量级的 Stage~1 对齐器使用每个实体 SAM~3.1 掩码监督和 InfoNCE 正则器进行训练,并且其连续显着性通过配对路由运算符融合到 TRD 中,只要每个标记对的两个端点之一显着,该运算符就会为每个标记对分配一个权重,从而将监督路由到主题-主题和主题-背景对,而不是背景-背景对。在 Wan2.2 持续训练设置中,SARA 在 13 维 VLM 规则、公共 VBench 基准测试以及盲用户研究中比 SFT、VideoREPA 和 MoAlign 提高了文本对齐和运动质量。项目页面:https://saradit.github.io/。