论文

改进判断:用于单图像 3D 生成的去偏 VLM-as-3D 判断协议

Judging to Improve: A De-biased VLM-as-3D-Judge Protocol for Single-Image 3D Generation

模型评测评测方法与指标

摘要

一项配套研究建立了一种去偏的、跨模型的 VLM 作为 3D 判断器,可以可靠地对单图像到 3D 网格质量进行排名,而廉价的几何体和 CLIP 代理则无法做到这一点。本文提出的问题是:法官的偏好能否以低廉且无需人工标签的方式专门针对一种资产类别(家具)提供强大的开放式生成器 TRELLIS?将评判从排名转向优化才是工作的所在。将 VLM 判断推入训练和评估循环会暴露从未触发的故障模式排名,因此我们的贡献是判断的优化级强化:训练判断 (Qwen2.5-VL-7B) 与评估判断 (InternVL3-8B) 不同,以打破循环;位置偏差校正;并修复了三种故障模式(图像过载、几何隐藏的splat渲染和奖励干净但错误输出的无参考判断),并带有校准证据(清晰差距获胜率0.83-1.0;基础与基础〜0.5)。使用该协议作为独立的评估器,并且仅使用具有轻量级参数高效适应的公共模型和数据,我们发现我们的方法符合强大的基础,而不是超越它。独立的基础样本基本上没有可学习的偏好(0.94 顺序翻转率),因此信号必须通过质量对比构造来设计。在六种适应方法、两种输入机制和严重性扫描中,最有针对性的——严重退化下的调节剂修复——达到了与基础相同的水平(0.50),而没有一种方法可以清除> = 65%的获胜率目标。结果是机械性的:干净的输入使判断饱和,flow-DIT 微调 通过采样器冲洗掉,而条件修复是移动几何体的轨迹。胜率在 n=8 个对象时是定向的。将强大的公共数据库与廉价的适配相匹配本身就可以提供丰富的信息:超过它需要的不仅仅是公共数据上的轻量级 PEFT,而且判断协议是可重用的。