论文
ExBind:视觉与可执行文件对应的受控诊断基准
ExBind: A Controlled Diagnostic Benchmark for Visual-to-Executable Correspondence
摘要
多模式编码和编辑系统必须将可见或语义指示物映射到可以编辑的确切可执行对象。错误的引用可能会选择有效但不正确的 DOM 节点、SVG 元素、图形端点、层次结构成员或表单元格,而最终执行成功本身并不能揭示失败的根源。 ExBind 将视觉到可执行的对应层隔离为语义定位和动作执行之间的受控诊断基准。它对与表示无关的潜在绑定实例进行采样,并将它们编译成 SVG、DOM、画布、树、图形和表格案例,并具有到可执行引用的确定性映射。模型仅输出严格的参考;评估器将预测映射回潜在结构并对结构约束进行评分,而无需推理跟踪。该版本包含一个 250 个案例的广泛套件、一个不相交的 240 个案例的目标套件和 50 个配对的潜在组。 Qwen2.5-VL-3B 的候选有效性为 98.4%,准确率为 76.4%,而 Qwen3-VL-4B 的候选有效性为 100.0%,准确率为 98.8%。在目标表套件中,所有 Qwen2.5-VL-3B 残差都是有效的正确行/错误列选择。候选顺序扰动会改变案例级别的结果,同时保留这种错误模式。 ExBind 专为受控诊断而设计,而不是群体规模排名或端到端编辑评估。代码和基准记录可在 https://github.com/Daerwang2020/Exbind 和 https://huggingface.co/datasets/Ziqianwwww/ExBind 获取。