论文

在早期算术教育中生成视觉表示的文本到图像模型的基准测试和增强

Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education

模型评测基准与评测资源

摘要

人工智能系统越来越多地用于支持教育内容创作,但目前尚不清楚它们是否能够生成忠实代表其要教授的教学概念的输出。因此,我们引入了方程到视觉生成,与传统图像生成相比,这项任务需要从算术方程生成具有教学意义的视觉效果,同时精确保留其数值和关系结构。根据对教师的采访和对教育材料的分析,我们构建了 E2V-Bench,这是一个涵盖四种基于教学的视觉类型的基准,以及用于评估视觉正确性的自动指标。我们的评估表明,最近的文本到图像(T2I)模型经常在这项任务上失败,错误主要是错误的对象计数和破坏的关系结构。在此基础上,我们探索基准引导的增强策略。这些策略改进了代表性模型,而剩余的差距则需要在未来的 T2I 模型中提供更强大的数值和关系基础。