论文
保留、揭示、扩展:通过区域感知调节和基准测试实现忠实的 4D 视频编辑
Preserve, Reveal, Expand: Towards Faithful 4D Video Editing with Region-Aware Conditioning and Benchmarking
摘要
虽然 4D 驱动的视频扩散模型可以生成视觉上合理的视频,但忠实的 4D 编辑提出了更严格的要求:应保留源观察的内容,而必须自然地合成被遮挡和视野外的区域。我们确定了现有方法中的一个关键故障模式,我们将其称为证据角色不匹配:源支持的观察、不确定的渲染线索和不受支持的区域纠缠在单个条件信号中,这可能导致保存漂移、重影和不稳定的外推。为了缓解这个问题,我们提出了 PREX(保留、显示、扩展),这是一种区域感知框架,可根据观测支持和场景范围将目标时空体积分解为三个不同的角色。 PREX 将编辑的 4D 点追溯到源帧并检索观察到的颜色,并将这些外观线索与几何感知的置信度和区域角色配对,并通过经过自监督代理编辑任务训练的适配器将它们注入冻结的视频扩散骨干中。我们进一步引入了 PREBench,一个专门为 4D 视频编辑设计的诊断基准,以暴露和量化此类特定于区域的故障。 PREBench 分别评估 4D 驱动视频扩散模型生成的视频的保留保真度、显示质量和扩展可信度。实验表明,与现有的基于 4D 的视频扩散方法相比,PREX 大大减少了特定区域的故障模式,同时保持了强大的视觉质量和 4D 编辑控制。代码将公开发布。项目页面:https://ricepastem.github.io/PREX-Open