论文
用于参数高效的多镜头长视频外推的提示适配器上下文路由
Prompt-Adapter Context Routing for Parameter-Efficient Multi-Shot Long Video Extrapolation
摘要
我们提出了 PACR-Video,这是一种用于多镜头长视频外推的参数高效框架,可以保留重复实体、场景结构、视觉风格和因果进程,而无需完整的生成器 微调。 PACR-Video 保持文本到视频的扩散 Transformer 冻结,并通过由学习的镜头角色提示标记调节的低秩时间适配器对其进行增强。为了保持长期连贯性,它构建了一个递归提示库,存储先前镜头中的紧凑实体、位置、动作和风格提示,然后根据预测的叙事依赖性将它们路由到适配器门。镜头局部/故事全局调整目标结合了下一个镜头重建、跨镜头身份对比和即时稀疏正则化,而适配器组合时间表平衡了早期镜头视觉一致性与后期镜头事件进展和视点变化。在六个多镜头和长视频基准测试中,PACR-Video 在分布质量、语义对齐、身份一致性、时间平滑性、运动稳定性、过渡连贯性和人类偏好方面优于文本到视频、基于调整、内存增强、流媒体和递归上下文基线。这些结果表明,紧凑的即时路由和轻量级的时间自适应为稳定的长视频外推提供了足够的可控能力。