论文
METER:评估 大语言模型 中的多级上下文因果推理
METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models
摘要
上下文因果推理对于 大语言模型 (LLM) 来说是一项关键但具有挑战性的功能。然而,现有的基准通常在分散的环境中评估这项技能,无法确保上下文一致性或覆盖完整的因果层次结构。为了解决这个问题,我们开创了 METER,在统一的上下文设置下,在因果阶梯的所有三个级别上系统地对 LLM 进行基准测试。我们对各种 LLM 的广泛评估表明,随着任务提升因果层次,熟练程度显着下降。为了诊断这种退化,我们通过错误模式识别和内部信息流跟踪进行深入的机制分析。我们的分析揭示了两种主要的失败模式:(1)LLM 很容易受到因果关系不相关但事实上正确的较低因果关系信息的干扰; (2) 随着任务沿着因果层次结构上升,所提供上下文的 忠实性 会降级,从而导致性能下降。我们相信我们的工作增进了我们对 LLM 上下文因果推理背后机制的理解,并为未来的研究奠定了重要的基础。我们的代码和数据集可在 https://github.com/SCUNLP/METER 获取。