论文

领域自适应预训练增强大规模结构化文献挖掘的水处理语义表示

Domain-Adaptive Pretraining Enhances Water Treatment Semantic Representation for Large-Scale Structured Literature Mining

模型训练预训练

摘要

水处理研究正在迅速扩大,但从这项研究中获得的大部分知识仍然分散在非结构化文献中。该领域仍然缺乏能够有效捕获水处理特定领域语义以进行大规模文献挖掘的专用语言模型。在这里,我们通过开发 WaterBERT 来解决这个问题,这是一种适应领域的编码器模型,专为语义表示和从水处理文本中提取结构化信息而设计。 WaterBERT 是通过对包含约 29.7 亿个词元的大规模水处理语料库进行持续预训练而开发的。基于WaterBERT的三个微调模型在下游任务上进行了系统评估,在通用和特定领域的BERT模型中取得了最佳的整体性能,多类处理过程分类的F1分数为90.12%,命名实体识别的F1分数为79.50%,关系提取的F1分数为74.04%。除了这些基准任务之外,我们还进一步证明了 WaterBERT 在大规模文献处理方面的优势。 WaterBERT-BERTopic 应用于 5,144 篇环境科学与技术文章,在没有预定义类别的情况下确定了连贯、多样化和特定领域的研究主题。在 WaterBERT 的基础上,我们以远低于商业大语言模型的成本处理了 693,211 份摘要,同时保留了有竞争力的提取性能,以构建结构化的水处理知识图。然后将知识图与词汇和密集检索相结合,开发了水知识增强检索系统(WaterKERS),该系统的相关性得分为 77.7,大大优于基于文本的检索基线(54.7-64.5)。通过 WaterBERT,这项研究为水处理研究中的大规模信息处理和证据映射提供了紧凑且可扩展的语义基础。