论文
从单文档到跨文档:大语言模型 的基准多粒度事件分析
From Single- to Cross-Document: Benchmarking Multi-Granularity Event Analysis of Large Language Models
摘要
事件分析是信息提取的一个重要且基本的方向,涉及不同文档粒度的各种以事件为中心的任务。虽然大语言模型(LLM)在部分任务中已经初步取得了可喜的性能,但由于现有基准测试的文档粒度、任务设计和数据源的限制,其事件分析能力仍然缺乏全面的理解。为了解决这些限制,我们引入了 MiGUE-Bench,这是一个用于评估 LLM 在多粒度事件分析中性能的系统基准。为了支持大规模评估,我们首先开发了一个名为 MiGUE-Pipeline 的 LLM 驱动的自校正注释框架,能够通过自动标签可扩展地获取事件的高质量源数据。然后,我们在基准测试中设计了四个核心任务,即事件检测、关系推理、结构归纳和未来预测,以探索不同级别的模型能力,从原子事件细节到复杂的跨文档叙述。对最先进的 LLM 和检索增强生成 (RAG) 方法进行的大量实验描绘了当前的能力边界并确定了关键缺陷,为 LLM 在具有挑战性的事件分析任务中的未来改进提供了见解。