论文
Custom Forcing:自回归视频生成的免训练主体定制
Custom Forcing: Training-Free Subject Customization for Autoregressive Video Generation
摘要
自回归视频模型可实时生成分钟级视频,但从文本产出通用主体而非用户图像指定的特定主体。既有定制方法要么需要昂贵的逐主体优化,要么使用以双向注意力联合处理全部视频帧的预训练条件网络——都不是为因果流式设计的。我们提出Custom Forcing,训练自由方法:把基于参考的锚帧存入冻结自回归视频模型的持久KV缓存。固定锚面临两个限制:简单条件允许身份漂移,文本提示继续偏向通用主体。为此,漂移自适应值放大(DVA)按身份漂移程度缩放参考影响,锚对比引导(ACG)引导生成偏离通用类先验。两分钟rollout中,固定锚的DINO-I从0.58跌至0.42,Custom Forcing保持在0.58-0.62且不减少运动。Custom Forcing还取得高于双向定制方法的主体相似度、优于因果图生视频与参考生视频模型的30秒身份保持,同时每帧生成比这些长视频基线快9.5-28.5倍。