论文

HERMES:从地球科学超长文档中提取结构化知识的多智能体框架

HERMES: a multi-agent framework for structured knowledge extraction from ultra-long documents in geoscience

智能体系统Agent 架构与控制循环

摘要

地球科学领域的权威科学知识仍然很大程度上局限于传统专着和历史文献中,其中非结构化文本和复杂的布局阻碍了计算访问。我们引入 HERMES,这是一个可扩展的多代理框架,可以从超长的科学文档中提取结构化数据。使用协调的 大语言模型,HERMES 将域约束、验证规则和证据跟踪集成到统一的文档级提取过程中,该过程包含解析的文本、表格、图形和标题。该系统应用于 55 卷《无脊椎动物古生物学论文》,生成了一个包含 32,277 个化石分类实体和 451,878 个属性的结构化数据库,并在 https://treatise.geolex.org 上在线发布。各个化石组的提取性能保持稳定(实体的平均 F1 分数约为 0.90,属性的平均 F1 分数约为 0.91),相对于测试的完全手动基线,每卷效率提高了约六倍。在没有额外 模型训练 的情况下进行的古地磁学和地球化学评估证明了跨不同地球科学领域的转移。这项工作提供了一条将历史科学文献转化为面向公平的结构化数据的实用途径,为数据密集型学科和大规模知识整合提供了可持续的基础设施。