论文
MULTITEXTEDIT:图像中文本编辑中跨语言降级的基准测试
MULTITEXTEDIT: Benchmarking Cross-Lingual Degradation in Text-in-Image Editing
摘要
图像中的文本编辑已成为视觉内容创建的关键功能,但现有基准仍然绝大多数以英语为中心,并且经常将视觉合理性与语义正确性混为一谈。我们引入了 MULTITEXTEDIT,这是一个包含 3,600 个实例的受控基准测试,涵盖 12 种不同类型的语言、5 个视觉域和 7 种编辑操作。每个实例的语言变体共享一个共同的视觉基础,并与人工编辑的参考和区域掩码配对,隔离语言变量以进行跨语言比较。为了捕获粗略文本匹配指标遗漏的脚本级错误,例如缺少变音符号、反向 RTL 顺序和混合脚本渲染,我们引入了一种由两阶段 LVM 协议评分的语言保真度 (LSF) 指标,该协议首先跟踪编辑的目标文本,然后对其进行单独判断,相对于母语注释器达到 0.76 的二次加权 \k{appa}。使用 LSF 以及标准语义和掩码感知像素指标评估 12 个开源和专有系统,我们发现每个模型都有明显的跨语言退化,希伯来语和阿拉伯语最大,荷兰语和西班牙语最小,并且集中在文本准确性和脚本保真度而不是粗略的结构维度。我们还发现了普遍存在的语义和像素不匹配,其中输出保留了全局布局和背景保真度,但扭曲了特定于脚本的形式。