论文
TerraVis:文生图世界一致性评测的MLLM工作流
TerraVis: Towards Evaluation of World-Grounded Visual Consistency in Text-to-Image Generation via MLLM Workflows
摘要
近期文生图模型在照片级真实感、美学与图文对齐上进步巨大,但视觉吸引人的图像仍可能违背现实合理性:畸形物体结构、不可能解剖、物理不合理的交互或不一致的空间关系。这类失败未被既有保真、美学、偏好或对齐指标很好捕捉。为弥补缺口,我们提出TerraVis——评估生成图像的世界接地视觉一致性的框架:定义横跨物体、交互与场景级失败的结构化世界一致性违例分类,并用多阶段评估框架识别与量化它们。给定图像,TerraVis先用MLLM评估其可评性,再检测18类分类定义的违例并区分轻重,导出总体世界一致性分数。在两个广泛使用的基准上跨多样开源与商用文生图模型,TerraVis在现有指标中与人类世界一致性判断的相关性最强。基准结果进一步显示:在常规指标上表现强劲的模型仍可能存在实质性的世界一致性失败。这些发现凸显世界一致性作为补充性评估维度,并证明TerraVis能系统量化、诊断与比较此类失败。代码/项目页:https://github.com/ShyFoo/TerraVis。