论文
ShapeCodeBench:合成形状场景的感知到程序重建的可更新基准
ShapeCodeBench: A Renewable Benchmark for Perception-to-Program Reconstruction of Synthetic Shape Scenes
摘要
我们引入了 ShapeCodeBench,它是感知到程序重建的综合基准:给定渲染的光栅图像,模型必须发出可执行的绘图程序,确定性评估器重新渲染该程序并与目标进行比较。 v1 DSL 在 512 x 512 黑白画布上有四个基元,但每个实例都是从种子 RNG 生成的,因此可以创建新的保留集以减少精确实例污染。我们发布了一个冻结的 eval_v1 分割,包含简单、中等和困难层的 150 个样本,通过精确匹配、像素精度、前景 IoU、解析成功和执行成功进行评分。我们评估了空程序层、经典的计算机视觉启发式、高和最大努力的 Claude Opus 4.7,以及中等和超高推理努力的 GPT-5.5。该启发式算法在简单的场景中具有竞争力,但在重叠熔断组件时会崩溃;最强的多模态配置保留了大部分前景结构,但由于参数误差较小,仍然无法精确匹配。最佳整体精确匹配仍然很低,因此 ShapeCodeBench 远未饱和。发布基准代码、冻结数据集、运行工件和论文来源,以支持独立复制和扩展。