论文
LongNovel:长上下文小说摘要中幻觉检测的多尺度基准
LongNovel: A Multi-Scale Benchmark for Hallucination Detection in Long-Context Novel Summarization
摘要
尽管近年来上下文窗口已显着扩大,但长上下文摘要中的幻觉仍然是一个挑战。长篇小说比新闻或报纸更适合研究这些幻觉,因为它们具有内在的信息以及对事件和对话的详细描述。然而,目前的研究缺乏长语境小说摘要中幻觉检测的多尺度基准,也没有充分探索幻觉如何随着语境变长而变化。在这项研究中,我们提出了 LongNovel,一种用于幻觉检测的多尺度长上下文双语(中文和英文)小说基准。该基准由 29 部中国小说(从 16k 到 100k 标记不等)和 BookSum 数据集中的章节级数据构建。我们设计了 8 种幻觉类型,并采用多模型仲裁和实体引用幻觉生成相结合,以确保数据真实性和幻觉类别的平衡分布。此外,我们手动修改测试集中的内容以保证数据的可靠性。大量的实验结果表明,LongNovel 是一个具有挑战性的基准。我们发布长篇小说以供未来研究。 https://github.com/BDML-lab/LongNovel