论文
YOSE:您只需选择基本词元即可实现基于 DiT 的高效视频对象删除
YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal
摘要
基于 Diffusion Transformer (DiT) 的视频生成技术的最新进展在视频对象去除方面显示出了令人印象深刻的结果。然而,这些方法仍然存在很大的推理延迟。例如,尽管 MiniMax Remover 实现了最先进的视觉质量,但它的运行速度仅为 10FPS 左右,这主要是由于整个时空标记空间上的密集计算,即使实际上只有一个小的遮罩区域需要处理。在本文中,我们提出了 YOSE,You Only Select Essential Tokens,一个高效的 微调 框架。 YOSE 引入了两个关键组件:批量可变长度索引 (BVI) 和扩散过程模拟器 (DiffSim) 模块。 BVI 是一种可微动态索引运算符,可根据掩码信息自适应地选择基本标记,从而实现跨样本的可变长度标记处理。 DiffSim 为未屏蔽 token 提供了一种扩散过程近似机制,它模拟 DiT self-attention 中未屏蔽区域的影响,以保持屏蔽 token 的语义一致性。通过这些设计,YOSE 实现了掩模感知加速,其中推理时间与掩模区域近似线性缩放,而全词元扩散方法的计算保持不变,而与掩模大小无关。大量实验表明,YOSE 在 70% 的情况下实现了高达 2.5 倍的加速,同时保持了与基线相当的视觉质量。代码位于:https://github.com/Wucy0519/YOSE-CVPR26。