论文

EviMap:用于探索未标记语料库的循证分层主题图

EviMap: Evidence-Grounded Hierarchical Topic Maps for Exploring Unlabeled Corpora

摘要

研究团队和组织经常在标签、查询或编码方案存在之前探索不熟悉的自由文本集合,从调查评论和评论到报告和领域文档。在这个阶段,第一个专题地图会确定用户注意到的内容、优先级并进行下游分析,因此只有在可以验证的情况下才应该信任它。现有的选择迫使我们在规模和可验证性之间进行权衡。定性编码可以保留证据,但速度很慢。搜索以查询为前提。聚类和主题模型可扩展,但会产生用户必须解释的标签。一次性 大语言模型 (LLM) 摘要很流畅,但难以复制或审核。我们推出了 EviMap,这是一个交互式系统,为研究人员和从业者提供此类语料库的可审核的主题概述。在模型生成的描述语料库和假设的利益相关者关注点的上下文的指导下,EviMap 提取文档内证据短语并将其(而不是整个文档)组织成方面、组和细粒度主题的三级地图。基于嵌入的聚类缩小了 LLM 进行更精细语义判断的搜索空间。每个节点都可以追溯到支持的短语范围,因此文档通过其包含的证据链接到主题,并且用户可以根据原始文本审核标签。用户可以从顶级语料库地图开始,深入研究主题,检查原始文档中突出显示的证据,并将两个主题结合起来查找讨论这两个主题的文档。我们在涵盖 2,108 至 101,699 个文档的六个异构语料库中演示了此工作流程,并与平面和分层 LLM 基线进行了比较。通过逐字源跨度中的每个标签,EviMap 使主题图不仅可读,而且可验证。代码、演示视频和交互式仪表板可在 https://github.com/zhiyintan/EviMap 上获取。