论文

前馈 3D 重建模型置信度的校准审核

A Calibration Audit of Confidence in Feed-Forward 3D Reconstruction Models

模型评测鲁棒性、公平性与可信度评测

摘要

前馈 3D 重建模型输出每像素置信度,下游系统将其用作不确定性信号。置信度被训练作为模型训练损失的权重。置信度是否可以作为不确定性大小尚未衡量。我们审核了 13 个数据集的 7 个主干网,并对四个属性的置信度进行评分,即误差排名、平均误差与不确定性的比率、该比率在置信范围内的斜率以及隐含误差分布的覆盖范围。尽管置信度对误差进行了很好的排名,但从置信度解码的不确定性与实际误差相比太小。只有在精确的训练条件下,不确定性才具有正确的大小。所有 7 个模型的中值情况至少相差 2.4 倍,而模型的置信度越高,不确定性就越大。我们的工作表明,即使模型达到损失的最佳值,过度自信也会出现在看不见的场景中。作为事后修复,我们将幂律拟合为每个主干数据集对的两个常数的置信度。修复将所有四个审核属性带到数据集级别的目标,同时保持排名不变。与保留的目标数据集拟合后,这些常数将中位数情况从 2.4 倍降低到 1.35 倍。修复无法保持在数据集级别以下,其中三分之二的保留场景的覆盖范围仍超出五个点以上。我们将修复无法达到的部分归因于模型,该模型既不包含错误的规模,也不包含其在预测中的分布形状。我们发布了审计协议、其结果以及每个骨干数据集对的拟合常数。