论文

CAGE:通过代码锚定生成增强缩小教育图的准确性与美观差距

CAGE: Bridging the Accuracy-Aesthetics Gap in Educational Diagrams via Code-Anchored Generative Enhancement

应用与实践内容创作

摘要

教育图表——生物过程、化学结构、物理系统和数学概念的标记插图——是 K-12 教学中必不可少的认知工具。然而,现有的方法还没有能够准确且引人入胜地生成它们。开源扩散模型可以生成视觉效果丰富的图像,但会产生灾难性的乱码文本标签。通过 LLM 基于代码的生成可保证标签的正确性,但会产生视觉上平坦的输出。闭源 API 部分弥补了这一差距,但在教育规模上仍然不可靠且昂贵。我们在 400 K-12 图表提示上量化了所有三种范式中的这种准确性-美观困境,通过互补的自动化和人工评估协议来测量标签保真度和视觉质量。为了解决这个问题,我们提出了 CAGE(代码锚定生成增强):LLM 合成可执行代码,生成结构正确的图表,然后通过 ControlNet 以编程输出为条件的扩散模型将其细化为视觉上精美的图形,同时保留标签保真度。我们还介绍了 EduDiagram-2K,这是一个由 2,000 个配对的程序化图表组成的集合,可实现此管道,并为多媒体社区提供概念验证结果和研究议程。