论文
基于 LLM 的科学论文实体解析的可视化分析
Visual Analysis of LLM-based Entity Resolution from Scientific Papers
摘要
本文重点关注从大量科学文献中提取特定领域实体的可视化分析支持,这是一项使用传统命名实体解析方法具有固有局限性的任务。随着 GPT-4 等 大语言模型 (LLM) 的出现,由于 LLM 的实体解析能力集成了理解多种类型文本等能力,因此比传统机器学习方法取得了显着改进。这项研究引入了一种新的可视化分析管道,它将这些先进的 LLM 与多功能可视化和交互设计集成在一起,以支持批量实体解析。具体来说,我们专注于金属有机框架 (MOF) 的特定材料科学领域和大型数据收集,即 CSD-MOF。通过与材料科学领域专家的合作,我们获得了标记良好的合成段落。我们建议使用视觉分析技术对实体解析过程进行人机循环细化,这使得领域专家能够以交互方式将见解集成到 LLM 智能中,包括错误分析和检索增强生成 (RAG) 算法的解释。我们通过 RAG 示例选择的案例研究进行评估表明,这种人机协作方法将单文档实体解析精度提高了约 30%。