论文
你构建它:概念表征如何塑造 LLM 反犹太主义的检测和推理
You Frame It: How Conceptual Representations Shape LLM Detection and Reasoning about Antisemitism
摘要
LLM 能够在推理时整合外部概念资源,为检测反犹太主义等意识形态和历史复杂现象创造新的机会。我们研究了不同形式的概念基础如何影响四个最先进的 LLM 中的反犹太主义检测和解释行为。使用两个专家注释的数据集,我们比较了反犹太主义的定义、细粒度分类、示例增强和大上下文表示。我们发现细粒度的分类表示极大地提高了召回率,同时降低了精度。令人惊讶的是,提供更多的概念资源并没有产生额外的定量效益。大屠杀后的反犹太主义对各种模式和配置构成了最持久的挑战。对解释的分析进一步揭示了系统性的局限性,包括概念引用的过度产生、对词汇线索的依赖、过度自信以及反犹太主义的微妙或合理形式的困难。我们的研究结果强调了基于概念的 LLM 在反犹太主义检测和推理方面的潜力和剩余局限性。