论文
想象力是源于幻觉吗?大型语言模型中想象力和幻觉的跨分类学评估
Is Imagination Derived from Hallucination? A Cross-Taxonomy Evaluation of Imagination and Hallucination in Large Language Models
摘要
想象力是大型语言模型 (LLM) 的高级功能,它决定了 LLM 如何创造看不见的或创造性内容的潜力。虽然现有的作品已经为这种能力建立了丰富的创造力基准,但它们只衡量输出与常见答案的偏离程度,而从不检查这种偏离是否得到提示的许可。此外,与想象力最接近的幻觉总是在不同世代的单独管道中进行测量,因此想象和幻觉源于同一生成机制的有影响力的主张从未得到直接检验。在本文中,我们提出了Whiteboard,第一个LLM想象力评估基准。其设计遵循为测量人类想象力而开发的权威认知工具:七个基于机制的想象力亚型改编自经典范式,然后与十个支持边界幻觉亚型交叉并在同一代上共同评分。与以前的创造力或幻觉基准不同,Whiteboard 通过显式支持检查来控制每个想象力分数,并通过可审计的原子矩阵确定性地计算两个轴,在主要路径上没有 LLM 判断。完整的白板项目库包含 1,660 个提示;在其共享的 80 项锚定集上,我们评估了 79 个最先进的大语言模型,并根据 13,280 个人类判断验证了该工具。此外,我们还进一步探讨想象力是否源自与幻觉相同的生成倾向,以及塑造它的关键因素。我们的分析表明幻觉和想象之间存在一种违反直觉的相关性:大多数子类型耦合都是负耦合,每个锚定项目都会自行再现负耦合。