论文
LiveStre4m:来自未展示的多视图视频的新颖视图的前馈直播
LiveStre4m: Feed-Forward Live Streaming of Novel Views from Unposed Multi-View Video
摘要
来自未摆出的多视图视频的实时流式新颖视图合成(NVS)在广泛的应用中仍然是一个开放的挑战。现有的动态场景表示方法通常需要 真值 相机参数,并涉及冗长的优化($\大约 2.67$s),这使得它们不适合直播场景。为了解决这个问题,我们提出了一种新颖的视点视频直播方法(LiveStre4m),这是一种来自未设置的稀疏多视图输入的实时 NVS 的前馈模型。 LiveStre4m 引入了用于关键帧 3D 场景重建的多视图视觉 Transformer 以及扩散 Transformer 插值模块,可确保时间一致性和稳定的流传输。此外,还提出了相机姿态预测器模块,可以直接从 RGB 图像中有效地估计姿态和内在特征,从而消除对已知相机校准信息的依赖。我们的方法可以使用少至两个同步的未摆出的输入流来实时实现时间一致的新颖视图视频流。 LiveStre4m 在 1024 × 768分辨率下每帧的平均重建时间为 0.07秒,运行时性能优于基于优化的动态场景表示方法几个数量级。这些结果表明,LiveStre4m 使实时 NVS 流在实际设置中变得可行,标志着向可部署的实时小说视图合成系统迈出了实质性的一步。代码位于:https://github.com/pedro-quesado/LiveStre4m