论文
DB-3DME:从数据集到人体对齐自动 3D 网格评估的基准
DB-3DME: From Dataset to Benchmark for Human-aligned Automatic 3D Mesh Evaluation
摘要
3D 生成领域的最新进展极大地提高了真实性、可控性和效率,但 3D 资产的评估仍未得到充分探索。现有的评估范式,包括人类评估、学习指标和作为法官的视觉语言模型 (VLM),都受到成本、可扩展性、分辨率处理或特定任务对齐方面的限制。在这项工作中,我们重点关注 3D 网格评估并介绍 DB-3DME、3D 网格评估的数据集和基准。 DB-3DME 包含 2,619 个合成 3D 网格,并与人类对几何和提示依从性的评分配对。使用该数据集,我们系统地对最先进的 VLM 进行基准测试,并将 3D 表示的视觉编码确定为与人类一致的评估性能的关键因素。受这一发现的启发,我们通过在冻结语言模型的同时调整视觉编码器来微调开放权重 VLM Qwen-2.5-VL-7B,以进行 3D 网格评估。经过微调的模型在多个评估维度上显着优于现有的预训练 VLM,为自动 3D 网格评估建立了新的基准。我们在 GitHub 和 Hugging Face 上公开发布基准数据集,以方便未来的研究。