论文

Vector-Bench:模型能对SVG代码做外科手术式编辑吗

Vector-Bench: Can Models Surgically Edit SVG Code?

模型评测基准与评测资源

摘要

基于指令的矢量编辑需要两种能力:完成所请求的修改,并且不动其他一切。当输出仅作为位图图像评判时,第二种能力容易被忽视。我们提出Vector-Bench,一个紧凑而困难的40项SVG修复任务基准。每个任务配对一个损坏的SVG程序与作者撰写的视觉指令、隐藏的目标程序、平均5.05处标注修复与平均60.55个受保护对象。指令描述可见缺陷而不暴露元素标识符、坐标、色值或路径数据。我们定义确定性的二元规格奖励:所请求的修复使用属性感知的感知容差,而未请求的渲染或应用相关结构必须语义不变,且结果必须是有效SVG。规范目标等价与更严格的源保真保留为诊断项。有效性门控的修复进度、近完整层级与有效输出的意外更改率(UCR)解释部分结果。我们评估34个模型端点(25个开放权重、5个廉价对照、4个前沿闭源)共1,360次请求。最强端点仅达15.0%的完全规格成功,尽管平均修复进度43.7%——表明表观修复进度与规格忠实的编辑仍实质不同。全部提示、输出、评分代码、成本与逐任务报告已发布。

Vector-Bench:模型能对SVG代码做外科手术式编辑吗:论文配图
图 1:代表性损坏的输入和隐藏目标。公共提示以普通语言描述可见错误,而不命名源 ID 或透露目标数字/路径值。