论文

零样本文本可视化:用用户定义的概念轴探索语料库

Zero-Shot Visualization: Exploring Text Corpora with User-Prompted Axes

模型评测评测方法与指标

摘要

我们研究了大语言模型 (LLM) 在文本语料库的视觉探索中的应用。我们引入了零样本可视化(ZSV),这是一项用户用自然语言指定概念并将文档映射到相应概念轴以进行可视化的任务。构建具有实用价值的 ZSV 系统并非易事,因为它需要在特征功能的交叉点、有效的实现权衡以及影响可视化质量的前/后处理决策方面进行选择。为此,我们建立了一个基准,比较在此设置中的嵌入相似性、直接语义判断和条件似然估计的方法。在多个数据集和用例中,我们从语义忠实度、分数保真度和计算成本方面评估不同评分方法和设计选择的属性。我们的结果表明,基于 next-token 概率的评分在评估方法中提供了最强的实际权衡。我们进一步将这种方法应用于未标记的语料库,以检查其在现实探索环境中的行为。这些实验强调了额外的设计考虑因素,包括使用分级轴和二元相关性过滤,并揭示了偏离主题的文档中的成分情感偏差。基于这些发现,我们提供了构建端到端 ZSV 基线的实用指南。