论文

提取强制位移和 FCV 文档中的数据集提及:基于 LLM 标签细化的弱监督框架

Extracting Dataset Mentions in Forced Displacement and FCV Documents: A Weakly Supervised Framework with LLM-Based Label Refinement

模型训练合成数据

摘要

发展和人道主义组织制作并支持调查、行政登记和其他数据资源,为研究、政策和运营提供信息,但系统地确定这些数据集的引用位置仍然很困难。此类参考资料分散在研究论文、项目文件、人道主义报告和其他非结构化文本中,限制了追踪数据使用和识别数据可用性或传播方面潜在差距的能力。我们提出了一个弱监督框架,用于使数据集提取适应强迫流离失所和脆弱、冲突和暴力(FCV)文档,而无需首先构建大型手动标记的训练语料库。在一般研究文献上训练的轻量级模型从未标记的领域文档中生成候选数据集提及,前沿大语言模型 (LLM) 在上下文中进行审查,验证或拒绝候选数据并纠正其提取边界。由此产生的注释辅以有针对性的合成和对比示例,并用于微调轻量级模型以进行大规模提取。我们根据涵盖研究、人道主义和运营文件的 1,706 段文本段落的独立黄金标准基准来评估最终模型。在整个基准测试中,该模型在提及级别实现了 74.1% 的准确率和 70.5% 的召回率;在包含数据集参考的段落中,精度达到89.5%。在段落级别,该模型在区分具有数据集引用的段落和没有数据集引用的段落方面实现了 88.2% 的准确度和 88.6% 的特异性。这些结果展示了在标记数据有限时构建特定领域监督的实用方法,并为更大规模的数据使用分析和位移数据景观中的潜在差距提供了技术基础。