论文

PhantomBench:对语言模型不存在的威胁进行基准测试

PhantomBench: Benchmarking the Non-existential Threat of Language Models

模型评测基准与评测资源

摘要

幻觉,即语言模型 (LM) 生成事实上没有根据的反应,会带来严重的风险,因为用户往往会盲目依赖它们。这在高风险领域尤其令人担忧,这种模型行为的后果可能会导致重大危害。尽管在理解幻觉方面取得了显着进展,但仍不清楚这些模型如何可靠地认识到其知识的局限性。我们推出 PhantomBench,这是同类中的第一个大规模基准测试,包含超过 60K 个不存在的术语和实体,这些术语和实体源自不同领域的真实概念。使用我们的基准,我们评估了总共 21 个不同类型和尺寸的模型。我们全面展示了惊人的幻觉率(在某些情况下平均幻觉率高达 86.7%),并注意到即使是前沿模型也令人惊讶地未能放弃不存在的概念,特别是当输入假设它们存在时。然后,我们证明 PhantomBench 可以作为研究模型在罕见概念上的行为的代理,而模型更容易产生幻觉。我们还提供了构建 PhantomBench 的管道,能够根据研究人员和从业者的特定需求,可扩展地生成不存在的概念。