论文

ICDepth:通过上下文调节驯服视频扩散模型以进行视频深度估计

ICDepth: Taming Video Diffusion Models for Video Depth Estimation via In-Context Conditioning

上下文与知识上下文工程

摘要

单目视频深度估计需要时间一致性、几何精度和跨不同场景的泛化,但现有方法很难同时实现这三个目标。判别模型在每帧精度方面表现出色,但由于上下文窗口有限而遭受时间漂移,而生成方法以大量训练数据(10M+样本)和缺乏几何精度为代价提高了一致性和泛化性。针对这些问题,我们引入了 \textbf{ICDepth},这是一个框架,它采用预先训练的文本到视频扩散 Transformer,通过上下文条件(ICC)进行视频深度估计,利用其丰富的时空先验。为了解决将 ICC 从生成转移到密集预测的关键挑战,我们建议:(1)~\textbf{SAND-Attention},通过共享 RoPE 确保精确的时空对齐,并强制单向注意以防止噪声污染; (2)~\textbf{SRFM},注入DINOv2语义和分辨率先验以增强几何精度。 ICDepth 在多个基准测试中取得了最先进的结果,具有显着的数据效率,仅在 0.8M 帧上进行训练(比竞争生成方法少 6$-$13\times$),同时展示了对不同领域的强大的零样本泛化能力。