论文

视差有征兆:零视差平面之外的立体匹配

Disparity Has a Sign: Stereo Matching Beyond the Zero-Disparity Plane

模型评测基准与评测资源

摘要

当视差过零时,现代立体匹配模型就会失败,端点误差 (EPE) 会上升 4.6-37$\times$。然而,从影院 3D 到 VR,立体内容通常包含零视差平面 (ZDP) 后面的对象,对应于负视差。盲点通过数据集、架构和评估协议级联,所有这些都继承了非负几何。校正并行相机将 ZDP 置于无穷远,因此每个有限深度都会通过构造产生 $d=fB/z \ge 0$,并且标准管道中的任何内容都不能违反甚至测量负视差。为了测量它,我们提出 \textit{ZDPShift},这是来自七个电影摄影师创作的开放电影的 $21{,}495$ 立体声对的基准,每个帧在五个零视差平面位置处渲染,并带有密集签名的 真值。一旦飞机移动,六个最先进的图像和视频立体匹配模型就会崩溃。在相同的场景内容上,FoundationStereo 从 2.24 美元 px EPE 到 75.33 美元 px,每个主干留下大约一半的像素超过三像素视差误差。然而,缺少的并不是底层的匹配能力。 % 然而,该功能本身已经存在。对 SceneFlow 合成的监督进行训练,不添加新数据或参数,使误差在有符号范围内保持平坦。仅训练解码器,并冻结预训练的匹配功能,在所有六个骨干网中的性能相当,EPE 抖动在 0.2$px 以内。因此,预训练的特征已经扩展到它们从未训练过的负面状态,只有输出约定将其丢弃。与此同时,KITTI、Middlebury、ETH3D 和 Sintel 的正向政权准确性在很大程度上得以保留。