论文

用于单图像 3D 网格质量的跨模型 VLM-Judge 协议(以及为什么廉价代理达不到要求)

A Cross-Model VLM-Judge Protocol for Single-Image 3D Mesh Quality (and Why Cheap Proxies Fall Short)

模型评测评测方法与指标

摘要

单图像到 3D 生成器正在快速改进,但还没有一致同意的、无需人工干预的方法来判断一个生成的网格是否比另一个更好。从业者通常依赖廉价的自动代理(渲染空间 CLIP 相似性和网格几何有效性统计),但这些跟踪感知质量的效果如何尚未确定。我们做出了两项贡献。首先,我们提出并验证了一个可重复的 VLM 判断评估协议:一个固定的 24 视图无头渲染装置、两个独立的视觉语言判断系列,以及一个强制位置偏差校正,用于查询两个呈现顺序并仅保留顺序一致的判决。两个法官家族的观点基本一致(Cohen 的 kappa = 0.66),远高于机会协议下限。其次,使用该协议作为参考,我们表明廉价代理不能替代它。平均而言,几何有效性只是一个微弱的信号(因为,正如我们所展示的,它是双峰的)并且保持低于我们预先注册的目标,而渲染剪辑是有机会的。学习过的 Bradley-Terry 头会崩溃到单个流形统计(赋予渲染 CLIP 负权重)并仅精确匹配几何图形,因此学习特征权重不会带来任何好处。代理也是双峰的:它在与可见几何缺陷的对比上明显高于机会,但在模糊对比上有机会,与仅当缺陷在视觉上显着时跟踪判断的几何有效性一致。因此,我们建议在测试条件下将 VLM-judge 协议作为可靠、可重复的评估器(Google 扫描对象上的两个前馈生成器,具有面掉落退化机制),并建议不要将几何/CLIP 代理作为优化目标。