论文

超越文本和表格:ComProScanner 中的视觉语言模型集成,用于从科学图形中高精度提取材料数据

Beyond Text and Tables: Vision-Language Model Integration in ComProScanner for Extracting Materials Data from Scientific Figures with High Accuracy

应用与实践科学研究

摘要

随着基于 大语言模型 的管道的开发,从科学文献中自动提取材料成分-性能数据取得了显着进展;然而,现有框架仍然仅限于文本和表格内容,忽视了专门以科学数据报告的定量财产数据的很大一部分。在这里,我们扩展了 ComProScanner,这是一个用于自动合成属性数据库构建的完全端到端多代理框架,具有基于本机视觉语言模型 (VLM) 的图形提取功能。该扩展引入了一个FigureExtractor实用程序,用于在所有支持的发布者中进行基于标题关键字的图形过滤,以及一个GraphExtractorTool代理,该代理将提取的图形传递到可配置的VLM,以从科学图表和绘图中恢复成分属性对。根据 LMArena 图排行榜,选择四个 VLM 进行评估,输入成本标准为每百万词元低于 1.50 美元。对已建立的 $d_{33}$ 测试语料库中的 50 篇压电陶瓷文章进行基准测试表明,Gemini-3-Flash-Preview 实现了最高性能,成分精度为 0.97,归一化 F1 分数为 0.97,同时仍然是四个评估模型中最具成本效益的模型。我们还在评估框架中引入了基于范围的值误差阈值参数,为从图形中提取的数值属性值提供了比精确值匹配更具物理意义的评估。这些贡献使集成 VLM 的 ComProScanner 成为第一个特定材料、全自动、多模式文献挖掘平台,能够从单个统一管道中的文本、表格和图形中提取结构化成分属性数据。