论文
3D-DefectBench:针对细粒度 3D 生成缺陷的视觉语言模型评估流程的受控因子研究
3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects
摘要
自动化评估对于扩展生成 3D 系统至关重要,在这种系统中,详尽的人工审查成本高昂且缓慢。然而,自动判断的可靠性取决于整个评估流程,不仅取决于底层视觉语言模型(VLM),还取决于如何呈现资产、提供哪些视觉证据、如何指定任务以及如何构建人类参考标签。我们介绍 3D-DefectBench,这是一个用于系统分析基于 VLM 的 3D 缺陷检测流程的基准和框架。它通过涵盖几何、纹理和提示遵循的九个细粒度二元缺陷补充了整体评级和成对偏好,为生成模型开发和判断评估提供了可操作的诊断。使用平衡因子设计,我们在 84 个推理设计和大约 320 万个评分缺陷决策中改变了四个管道因素:VLM、相机协议、视觉输入和提示模式,然后对更广泛的前沿模型集进行了分阶段验证。模型选择是与人类标签一致的最大决定因素,但其余因素也会影响性能,与模型选择相互作用,并且可以改变最佳配置。在评估的设计空间内,紧凑的六视图 RGB 协议的性能与更密集的多视图设置和通过深度或表面法线增强的输入相当,使其成为具有强大成本效益的默认设置。在这个标准化流程下,12 名 VLM 评委中的佼佼者仍然落后于训练有素的人类贴标员,而当专家共识标签被噪音更大的银色标签取代时,纹理一致性急剧下降。这些发现表明,自动化法官应该作为完整的管道进行评估,并在人类参考体系中进行校准,而不是仅作为独立模型进行基准测试。我们在 Hugging Face 上发布标签、提示、预测和羊角面包元数据。