论文
GeoFidelity-Bench:评估文本到图像街景生成中的块条件地理保真度
GeoFidelity-Bench: Evaluating Block-Conditioned Geographic Fidelity in Text-to-Image Street-View Generation
摘要
文本到图像模型可以根据“纽约市的一条街道”等提示生成可信的街道场景,但仍不清楚这些图像是否类似于所请求的地点或显示一般的城市外观。常用的评估指标主要衡量图像质量或文本对齐,并不直接评估地理保真度。我们引入了 GeoFidelity-Bench,这是一个用于评估生成的街景图像是否与指定街区级别的目标位置匹配的基准。该基准包含来自六大洲 25 个城市的 112 个街道街区,每个街区都配有一组真实的地图图像和地理元数据。根据此元数据,我们仅构建包含城市、街道和社区名称以及这些名称加上原始 GPS 坐标的提示。在六个开放权重文本到图像模型中,街道和社区名称提高了与目标位置的相似性,而原始 GPS 坐标仅增加了较小且不均匀的增益。在保持城市固定的情况下交换其他街区名称的控制提示会降低检索准确性,当替换邻里名称或两个名称时,下降幅度更大。生成的图像还将其目标块与本地替代块区分开来,其可靠性不如保留的真实图像。生成的图像与其提示之间的 CLIP 对齐几乎无法提供有关图像是否实现块级地理保真度的信息。 GeoFidelity-Bench 提供了一个受控测试平台,用于研究位置条件生成和衡量超越一般城市级别合理性的进展。