论文

矫正镜头:基于物理的视频眼镜摘除方法

Unwarping the Lens: A Physics-Grounded Approach to Video Glasses Removal

模型训练合成数据

摘要

从视频中高保真地去除眼镜是面部属性编辑中的一个主要挑战,因为底层的面部几何形状通常会被复杂的折射畸变和依赖于视图的镜面反射所掩盖。虽然大规模生成先验在通过静态图像修复去除眼镜方面显示出了希望,但它们通常缺乏维持身份、表达和姿势所需的结构约束,导致静态图像和动态序列中出现明显的“身份漂移”。在本文中,我们提出了一种新颖的转移框架,该框架解决了生成先验的随机性。我们的管道首先从商业级生成模型(Nano Banana、Gemini 3 Pro Image)中提取高保真合成人脸图像,通过三阶段结构过滤过程对其进行正则化,以保留身份、表情和姿势,最后在训练过程中应用基于物理的镜头光学模拟,以提供多样化的配对数据。此过程将 Nano Banana 的照片级真实感、多视图知识转移到专门的修复架构 JFSnet(联合特征空间网络)中。 JFSnet 将基于 DINOv2 的语义特征与用于空间重建的卷积解码器集成,利用平移等方差约束来提高时间一致性和高频细节保留。对精选的 Flickr-Faces-HQ (FFHQ) 子集(12,163 张图像)的评估表明,我们的方法实现了高保真度和结构准确性,同时保持 27.68 FPS 的推理速度。在 CelebV-Text 视频序列的感知研究中,我们的结果在视觉一致性、时间稳定性和整体恢复质量方面始终优于扩散和基于 GAN 的基线。