论文

CausalOPD:蒸馏因果链推理的第一步错误监督

CausalOPD: First-Wrong-Step Supervision for Distilling Causal Chain Reasoning

摘要

许多关键推理任务,包括临床诊断、法律判断和工业故障诊断,都需要依赖于步骤的因果链,其中早期错误会传播,正确的结论可能会掩盖无效的推理。尽管 大语言模型 在此类任务上表现良好,但隐私、延迟和可控性促使 蒸馏 进入本地可部署模型。标准轨迹模拟不能纠正学生自己的生成轨迹分布的过程错误。我们提出了 CausalOPD,一个在线课程流程 蒸馏 框架。知识增强型教师首先提供基于特定领域因果规则、实体关系和结构约束的轨迹。然后,学生生成 同策略 轨迹,教师识别第一个错误步骤,定义为可验证违反可用约束的最早转换。从已验证的前缀开始,短视野强化学习修复了这种局部故障。因果阶段课程按照错误的传播顺序,从证据级错误推进到机制级错误和结论级错误。在三个领域中,CausalOPD 比序列级在线过程 蒸馏 的平均路径正确性提高了 23.4 个百分点,并将正确标签错误推理率从 15.7% 降低到 4.4%。特定领域的 8B 学生在所有领域的路径正确性方面也超过了评估的专有参考文献。