论文

学习从用户生成的主题语料库中构建数据

Learning to structure data from user-generated thematic corpora

上下文与知识知识图谱

摘要

主题语料库(例如社交媒体社区)包含描述可以结构化的数据的非结构化文本。例如,这些包括社交媒体数据中提到的个人属性、行为和经历。提取结构化数据具有挑战性,因为相关属性通常是隐式的、依赖于领域且事先未知的。我们提出了一个完全自动化的迭代框架,用于在没有预定义本体的情况下发现和提取特定领域的属性模式。该框架使用大语言模型 (LLM) 归纳候选属性,按顺序合并语义重叠的属性,并分配结构类型。这些可以创建本体并用语料库中的值填充它。该框架还允许使用较小的大语言模型进行值提取,与大型大语言模型相比,其准确性损失可估计。我们在 5 个与健康相关的 Reddit 社区上评估了该框架。发现的属性与人类识别的属性达到 61% 的一致性,接近独立注释者之间 62% 的一致性。在大多数情况下,算法在不到 10 次迭代的时间内收敛到稳定的属性集。与人工注释相比,结构类型分配的准确率达到 82%,值提取的 F1 分数达到 0.8。在四个 LLM 系列中,当针对高容量参考 LLM 进行评估时,较小的指令微调模型的提取性能随模型规模增大而显著改善,支持知情的准确性与成本权衡。这些结果表明,可以自动发现与人类识别的属性相当的属性,从而能够经济且大规模地创建高质量的结构化数据集。通过消除对预定义本体的需求,迭代模型驱动的模式归纳为挖掘主题语料库提供了实用且可扩展的基础。