论文
TRaM-VSR:用于一步扩散视频超分辨率的重要性感知词元路由和合并
TRaM-VSR: Importance-Aware Token Routing and Merging for One-Step Diffusion Video Super-Resolution
摘要
使用大规模扩散 Transformer (DiT) 先验的视频超分辨率 (VSR) 可实现卓越的感知质量,但由于处理密集时空标记序列的二次计算成本,通常不切实际。现有的以效率为导向的方法存在不可逆的细节丢失和时间闪烁的风险,这一漏洞在一步扩散模型中尤其明显。为了解决这个问题,我们提出了 TRaM-VSR,一种用于自适应词元分配的词元路由和合并框架,利用上下文感知视频先验和网络级先验。首先,通过将运动敏感的时间线索与语义文本相似性融合、隔离动态对象和结构边界来估计标记重要性。接下来,离线规划器进一步校准和调整这种重要性,以指导跨最佳分组网络块的路由。从技术上讲,在每个路由组中,结构上关键的词元在高保真本地流中进行处理,而信息量较少的词元则聚合到紧凑的全局流中,这两者都通过网络深度进行调制,并与扩散模型的多粒度性质保持一致。大量实验表明,TRaM-VSR 显着加速了推理速度,同时保持了最先进的重建质量和鲁棒的时间一致性。代码可在 https://github.com/Ree1s/TRAM-VSR 获取。