论文

ERUnderstand:评测视觉语言模型对结构化ER图的理解

ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams

模型评测基准与评测资源

摘要

实体-关系图(ERD)是概念数据库设计的核心,但通常只以渲染图像而非机器可读模式的形式可得,限制了AI辅助的数据库工程。我们提出ERUnderstand,首个面向ER图结构化理解的大规模基准,包含从精选教学资源、真实模式与合成生成的样例中收集的2,960张图,覆盖多样的领域、表示法、复杂度层级和扩展实体-关系(EER)构造。每张图都配有标准化的机器可读表示,用于对模式元素进行细粒度评估。对最先进的视觉语言模型(VLM)的评估发现,虽然常见ERD元素能被可靠恢复(F1 > 0.74),但性能在弱实体(低至0.28 F1)、多值属性(0.14 F1)和N元关系(0.07 F1)上急剧下降。增强推理的模型将整体性能提升15-25%,但仍对语言先验和不断增大的图复杂度敏感。ERUnderstand为评估概念数据库模式的多模态理解提供了标准化基准。该基准、数据集、评估工具包和生成代码已在https://github.com/salinaria/ERUnderstand公开。

ERUnderstand:评测视觉语言模型对结构化ER图的理解:论文配图
图 1. Chen 的(左)和 Silberschatz 的符号(右)所示的 ERD 示例。