论文
PRISM:在 LLM 幻觉中探测推理、指令和源记忆
PRISM: Probing Reasoning, Instruction, and Source Memory in LLM Hallucinations
摘要
随着 大语言模型 (LLM) 从会话助理演变为能够处理复杂任务的代理,它们越来越多地部署在高风险领域。然而,现有的基准在很大程度上依赖于混合查询和后验评估、输出级评分,它量化了幻觉的严重程度,但对生成管道中幻觉出现的位置和原因的了解有限。因此,我们将幻觉评估重新表述为一个诊断问题,并提出了 PRISM,这是一个受控基准,它将幻觉分为四个维度:知识缺失、知识错误、推理错误和指令遵循错误,基于三个生成阶段(记忆、指令和推理)。 PRISM 包含跨 65 项任务的 9,448 个实例,并支持细粒度、阶段感知的诊断评估。通过评估 24 个主流开源和专有 LLM,我们发现了指令跟踪、内存检索和逻辑推理之间的一致权衡,表明缓解策略通常会以牺牲其他维度为代价来改善特定维度。我们希望 PRISM 提供一个框架来理解 LLM 幻觉背后的具体机制,最终加速值得信赖的 大语言模型 的开发。