论文

PainterBench:工具使用语言模型的图形发散思维基准

PainterBench: A Figural Divergent-Thinking Benchmark for Tool-Using Language Models

智能体系统Agent任务评测

摘要

图形发散思维是将给定的形状片段发展成独创图画的能力。对于人类来说,这种能力是通过不完整的绘图任务来评估的。我们引入 PainterBench,这是一个将不完整绘图任务移植到 agentic 设置的基准测试。Agent通过工具调用在画布上绘图,并在每一轮后观察结果。画布包含一个无法擦除的起始形状,Agent的目标是将这个形状合并到它可以生成的最具原创性的绘图中。该任务是开放式的,由Agent自行决定何时完成绘图。该基准测试在短期内测试增量视觉规划以及从预训练到多轮工具使用的创造性能力的转移。我们评估了从小规模到前沿规模的 14 种多模态语言模型。在初步研究和六次敏感性分析中,我们收集了 2,700 张图画,并对每张图画和 300 张人类参考图画进行了众包创造力和可识别性评级。我们还推出了适应 ViDrA 的自动评分器,可以预测人类对Agent绘图的创造力评级(随机保留测试分割的 r = 0.85)。 14 款模型的图形发散思维差异很大,而 GPT-6 Astra 生成了最具创意的绘图。相对于人类绘画,Agent绘画的创造力得分较高,但可识别性较低。我们发布最终图纸、每轮画布快照、工具调用跟踪、刺激库、基准Harness、众包评级 (N = 72,000) 和 ViDrA 检查点。