论文
场景冻结,赢家不断变化:文本转 3D 评估中的配置脆弱性
Frozen Scenes, Shifting Winners: Configuration Fragility in Text-to-3D Evaluation
摘要
当每个生成的场景保持固定时,文本转 3D 排行榜是否会发生变化?我们审核这个问题以进行渲染图像评估,其中相机设置和标题措辞成为测量协议的一部分。在来自 6 个生成器的 300 个冻结场景中,我们为 19 个对齐评估器以及一个感知质量控制改变了 8 个渲染和描述措辞因素,然后测试了 4 个目标场景降级。峰值配置方差超过 17/19 对齐评估器的生成器间方差,11/19 的按提示进行bootstrap得到的下界高于 1。排名比分数更稳定,但 18/19 评估者在某些配置下会改变他们的点估计最优生成器。成对协议裕度包络线显示哪些比较在测试设置中保持了方向。选定的对具有相反的逐点间隔,但在完整搜索的同时推理中没有排名反转能够通过全搜索范围的同时统计推断。因此,观察到的获胜者变化是描述性的,而不是确认的生成器优势的变化。灵敏度仍然是独立的:没有评估器,即使是无提示控制,在布局扰乱上超过 67% 的平局调整方向辨别力,这是诊断性的,而不是经过人工验证的真值。审核将分数稳定性、决策不确定性和目标敏感性分开,并建议使用依赖于协议的比较和选择感知的不确定性进行报告(生成器、分数、卡 ID)。