论文

使用 LLM 作为概念掌握模拟器,通过基于干预的时间序列因果发现进行数学推理

Mathematical Reasoning via Intervention-Based Time-Series Causal Discovery Using LLMs as Concept Mastery Simulators

模型推理推理策略与问题分解

摘要

最近用于改进 LLM 数学推理的方法,无论是通过基于 MCTS 的测试时间搜索还是因果图引导的知识注入,都无法识别哪些概念因果关系有助于正确答案,因为观察到的关联可能是虚假的,由问题难度等混杂因素驱动。我们提出 CIKA(知识激活因果干预),这是一个使用 LLM 本身作为干预模拟器的框架:提示将概念状态设置为“掌握”,正确性变化估计因果效应。我们将这个量形式化为介入能力探针(ICP),它诊断 LLM 是否可以使用给定的概念——与仅仅拥有知识不同。由于干预措施独立于问题难度来设置概念状态,因此 ICP 能够分离出观察方法无法分离的混杂因素。在 67 个筛选问题中,排名靠前的概念的 ICP (+0.219) 明显大于阴性对照的 ICP(+0.039;配对 $t$-test,$p < 10^{-6}$,Cohen 的 $d = 0.86$),证实探针能够区分因果相关的概念和不相关的概念。对 601 个 Omni-MATH 问题的分析进一步表明,已解决问题的 ATE 比未解决问题高 6.1$\time$(0.338 vs. 0.055),证实 ICP 可以预测问题解决的成功。使用权重完全冻结的 7B 参数 LLM,CIKA 在无污染 Omni-MATH-Rule 基准上实现了 69.7\%,总体达到 64.0\%,而 o1-mini 为 60.5\%,GSM8K 为 97.2\%,AIME 2024--2026 为 46--50\%, MathArena 上为 46.2\%。对于基础模型单独失败的问题,因果知识激活组件贡献了 33.8% 的正确答案,这表明 LLM 已经拥有但尚未激活必要的知识。