论文
DepthAgent:通过样本专家选择实现更好的通用深度估计
DepthAgent: Towards Better Universal Depth Estimation via Sample-wise Expert Selection
摘要
单目度量深度估计在大规模训练和通用相机建模方面取得了长足进步,但跨不同相机设置(例如透视、鱼眼和全景图像)的稳健部署仍然具有挑战性。现有的方法通常依赖于单个深度估计器,忽略了不同的模型编码不同的相机假设并在不同的输入域下表现最佳。在本文中,我们表明深度专家表现出很强的样本互补性:模型偏好与相机几何高度相关,多模型融合在个别专家不可靠的困难样本上带来最大的收益。受这些观察的启发,我们提出了 \textbf{\ours},一种用于自适应单目深度估计的视觉语言代理。 DepthAgent 将现有深度模型视为冻结工具,并学习分析场景和摄像机线索,通过多轮工具利用调用合适的专家,并选择或融合他们对每个输入的预测。为了优化这种离散决策以获得密集的几何质量,我们设计了一种多重奖励强化 微调 方案,该方案共同鼓励有效的工具执行、摄像机/场景分析、专家选择质量和推理效率。跨透视、鱼眼和全景基准的广泛实验表明,我们的性能始终优于个体专家、固定模型融合和不同的选择策略,在具有挑战性的样本上有很大的改进,凸显了专家选择和融合的关键作用。代码和模型将在发布后发布。