论文

LongE2V:使用视频扩散模型进行长视野基于事件的视频重建、预测和帧插值

LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models

模型训练监督微调与指令调优

摘要

从稀疏事件流中恢复高质量视频是一项具有挑战性的任务。回归方法通常会模糊纹理,而现有的生成模型则难以实现长期稳定性。我们提出了 LongE2V,这是一种利用预先训练的视频扩散先验来联合处理基于事件的视频重建、预测和帧插值的新颖方法。通过 微调 基础视频模型,我们的方法实现了高数据效率和卓越的感知质量。我们引入自回归展开和自适应上下文切换来减轻极长序列中的时间漂移​​。我们还建议使用交叉残差校正重新编码对齐,以确保帧插值期间精确的双向一致性。此外,事件体素密度增强可确保不同传感器分辨率下的稳健性。对现实世界基准的大量实验表明,LongE2V 在所有三个任务中都优于最先进的方法,表现出卓越的时间一致性和零样本泛化。项目页面:https://cdfan0627.github.io/LongE2V-page/