论文
走向人工普通教师:程序几何数据生成和视觉语言模型的视觉基础
Toward an Artificial General Teacher: Procedural Geometry Data Generation and Visual Grounding with Vision-Language Models
摘要
我们将几何教育中的视觉解释作为参考图像分割(RIS)问题进行研究:给定图表和自然语言描述,任务是为所参考的几何元素生成像素级掩模。然而,由于摄影场景和抽象、无纹理示意图之间的基本域转移,在 RefCOCO 等自然图像基准上训练的现有 RIS 模型在几何图上会发生灾难性的失败。为了解决缺乏合适的训练数据的问题,我们提出了一个完全自动化的程序数据引擎,可以生成超过 200,000 个合成几何图,具有像素完美的分割掩模和语言上多样化的引用表达式,需要零手动注释。我们进一步提出了视觉语言模型 (VLM) 的特定领域 微调,证明经过微调的 Florence-2 实现了 49% IoU 和 85% 缓冲 IoU (BIoU),而零样本设置中的 IoU <1%。我们引入了缓冲 IoU,这是一种几何感知评估指标,可考虑薄结构定位,并表明它比标准 IoU 更好地反映了真实的分割质量。我们的结果为构建能够提供基于视觉的几何问题的逐步解释的人工普通教师(AGT)奠定了基础。