论文
超越合理性:结构化资产的可验证细粒度图像编辑
Beyond Plausibility: Verifiable Fine-Grained Image Editing on Structured Assets
摘要
细粒度图像编辑需要的不仅仅是产生视觉上合理的结果:编辑器必须精确地执行所请求的属性更改,同时保持其他所有内容不变。然而,现有的基准在真实性和可验证性之间留下了重大差距:基于真实图像构建的基准通常依赖于人类或视觉语言模型判断,而确定性评估主要集中在合成形状画布上,面向应用的扩展主要限于图表。这使得很难准确确定执行了多少请求的编辑、哪里发生了意外的更改,以及模型之间的微小差异是否反映了真正的编辑能力或评估者的不确定性。为了弥补这一差距,我们推出了 VeriEdit-Bench,这是一个基准,可通过确定性的四轴评估,在现实的结构化资产中进行细粒度、忠实于指令的图像编辑。其 1,740 个案例是根据 153 个可扩展矢量图形 (SVG) 图形、图表、Web 界面和演示幻灯片的源代码编译而成。受控源代码编辑保留原始视觉上下文,同时生成精确的目标图像、像素级编辑蒙版和明确的编辑规范,从而实现沿四个轴的可重复评分:编辑保真度、保留、本地化和幅度。通过评估 11 位编辑,我们发现即使是最强大的模型也远未达到满分;图表和 SVG 图形之间相同的重新着色操作的排名相反;具有相似像素精度配置文件的输出在定位和变化幅度方面仍然可能存在很大差异。这种分解产生分级的、可验证的反馈,并暴露整体评分或依赖于评估者的判断可能掩盖的模型特定功能和故障概况。
