论文

IRC-Bench:根据第一人称回忆中的上下文线索识别实体

IRC-Bench: Recognizing Entities from Contextual Cues in First-Person Reminiscences

模型评测基准与评测资源

摘要

当人们讲述个人记忆时,他们经常依赖上下文线索而不是明确的名字来间接提及人物、地点和事件。这种隐含的参考是回忆叙事的核心:在治疗、档案和社会环境中使用的对生活经历的第一人称描述。它们提出了一个困难的计算问题,因为必须从分散的叙述证据而不是局部提及中推断出预期实体。我们引入 IRC-Bench,即隐式记忆上下文基准,用于评估记忆转录本中的隐式实体识别。该基准测试的目标是非局部性:实体识别线索分布在多个不连续的子句中,这与命名实体识别、实体链接或共指解析不同。 IRC-Bench 包含 25,136 个样本,这些样本是由 12,337 个维基数据链接实体构建的,跨 11 个主题领域的 1,994 个转录本。每个样本都将一个基于实体的叙述(其中明确提及目标实体)与一个省略实体的叙述(其中直接提及被删除)配对。我们评估了 LLM 生成、密集检索、RAG 和 微调 的 19 种配置。适应 QLoRA 的 Llama 3.1 8B 在开放世界环境中表现最佳(38.94% 精确匹配;51.59% Jaccard),而微调的 DPR 领先封闭世界检索(35.38% Hit@1;71.49% Hit@10)。我们发布了包含数据、代码和评估工具的 IRC-Bench。