论文

面向多讲座教育推理的证据支撑多模态知识图谱构建

Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning

上下文与知识知识图谱

摘要

讲义视频通过语音、幻灯片文本、图表和展示顺序将知识分散到不同媒介中,而仅基于文本的转录无法完全保留。本文提出了一种基于证据的多模态管道,该管道能够转录讲义、选择语义锚点、应用光学字符识别(OCR)并使用视觉语言模型提取仅由转录、OCR或视觉证据支持的概念和类型关系。提及被验证和规范化为一个有证明来源的知识图谱。在三个神经网络讲义中,管道处理了3,118帧、756个转录段落和559个锚点。它保留了1,022个概念和312个关系提及,产生了172个可验证的概念和282个关系,覆盖率为90.38%的终点覆盖率。初步的三个问题检索测试达到了100%的顶级准确率和100%的平均顶级5召回率。贡献是一个可审计的设计方法,而不是一个最先进的性能声明。

面向多讲座教育推理的证据支撑多模态知识图谱构建:论文配图
图 1:基于证据的多模态知识图谱构建流程。