论文

迈向通用因果推理机

Towards a Universal Causal Reasoner

模型训练合成数据

摘要

尽管因果推理很重要,但训练 LLM 进行因果推理仍然没有得到充分探索。现有的数据工作主要集中在因果关系的特定方面对 LLM 进行基准测试,这使得它们不太适合训练可推广的因果推理器。为了解决这个问题,我们提出了 UniCo,一种数据生成框架,它 (1) 解决 Pearl 因果阶梯中的 18 种因果查询类型,(2) 将本机符号示例转换为代码和自然语言形式,以模拟未明确指定因果项的现实世界用例。为了确保数据质量,UniCo 通过精确的因果推理来得出答案,并通过推理捷径来过滤案例。在使用 66.6K UniCo 生成的实例进行监督微调后,Qwen3-4B、Qwen3-8B 和 Olmo-3-7B-Instruct 在所有 18 种分布内查询类型中平均提高了 22.9%,在训练分布之外的 7 个既定因果基准上比最先进的因果数据生成框架提高了 8.1%。更重要的是,在现实世界的医学理解、法律决策和表格推理中,UniCo 训练的模型始终显示出更忠实的推理轨迹,在 忠实性 指标中平均优于基本模型 20.2%。这些表明以因果关系为中心的训练不仅可以强化因果推理,还可以让LLM在一般推理任务中具备因果思维。