论文
NoisyCausal:结构化噪声下评估因果推理的基准
NoisyCausal: A Benchmark for Evaluating Causal Reasoning Under Structured Noise
摘要
自然语言中的因果推理需要识别相关变量,理解它们的相互作用,并推理影响和干预措施,通常是在嘈杂或模糊的条件下进行。虽然 大语言模型 (LLM) 表现出强大的一般推理能力,但它们很难将相关性与因果关系分开,特别是当观察结果部分不正确或存在不相关信息时。在这项工作中,我们引入了 NoisyCausal,这是一个新的基准,旨在评估结构化噪声下的因果推理。每个实例都是从 真值 因果图生成的,并通过注入可控形式的噪声(例如不相关的干扰因素、价值扰动、混杂和部分可观察性)来与自然语言场景结合起来。此外,我们提出了一个模块化推理框架,将 LLM 与显式因果结构相结合来应对这些挑战。我们的方法提示 LLM 提取变量,从上下文构建因果图,然后将推理任务重新表述为基于该图的结构化提示。 LLM 不是仅仅依赖统计模式,而是以符号结构为指导,从而实现更可解释和更稳健的推理。实验结果表明,我们的方法明显优于 NoisyCausal 上的标准提示和推理基线。此外,它可以很好地推广到 Cladder 等外部基准测试,无需针对特定任务进行调整。我们的研究结果强调了将因果抽象与语言驱动推理相结合的重要性,以在 LLM 中实现忠实且可靠的因果理解。