论文
TurtleAI:Turtle 图形中可视化编程的多模态模型基准测试
TurtleAI: Benchmarking Multimodal Models for Visual Programming in Turtle Graphics
摘要
视觉语言模型 (VLM) 已被探索用于可视化编程,它们生成代码来解决视觉任务。然而,大多数先前的工作都集中在可视化编程以提高生产力;目前还不清楚当前的 VLM 在面向教育的可视化编程方面的表现如何以及哪些因素限制了其表现。为了弥补这一差距,我们引入了 TurtleAI,这是一个包含 823 个任务的基准测试,这些任务是根据 Turtle Graphics 领域中的真实视觉编程任务策划的。解决这些任务需要模型感知几何图案、推理空间关系并合成忠实再现几何图案的 Python 代码。我们评估了 20 多个 VLM,包括 GPT-5、GPT-4o 和 Qwen2-VL-72B,发现它们表现不佳,大多数成功率低于 30%。为了解决这些限制,我们提出了一种仅需要一小部分种子样本的数据生成技术。 微调 Qwen2-VL-72B 在生成的合成数据上使实际任务提高了约 20%。我们的失败分析表明,GPT-4o 在空间推理和精确视觉复制方面遇到困难,而 微调 主要改善了视觉推理和代码实现之间的一致性。