论文
CoEvo:用于多步骤因果推理的单一模型的基于 Oracle 的自我进化
CoEvo: Oracle-Grounded Self-Evolution of a Single Model for Multi-Step Causal Reasoning
摘要
多步骤因果推理需要链接推理,其中每个步骤都约束下一步。早期错误会悄无声息地传播,通过有缺陷的逻辑得出的正确答案会逃避结果级别的检测。在专业领域,大语言模型教师在中间步骤上犯了错误,安全约束限制了云蒸馏,不断变化的条件需要适应,使自我进化成为实际路线。幼稚的自我进化可能会崩溃:只注重结果的奖励让模型利用分配捷径,而薄弱的自我评估会强化通往稳定失败模式的虚假路径。我们利用了一个关键的不对称性:生成正确的链很困难,但验证单个步骤很容易。许多高风险领域都承认确定性的、可查询的预言机、物理模拟器或基于编码约束的规则引擎。它会检查没有教师级别能力的断言步骤,并放弃超出其规则的行为;它可以检查模型断言的内容,而不是替换它。这使得 CoEvo 成为可能,这是一个基于预言机的自我进化框架,其中单个模型在提议者和求解器之间交替。作为求解器,模型生成竞争链;组内辩论暴露了分歧步骤,这是能力边界的代理,并且预言机将它们裁定为流程级监督。作为提议者,相同的模型在预言机约束内构建了逐渐困难的场景,将课程引向深度多跳链。两个角色都是共同更新的,因此训练压力与模型共同演化。在工业、临床和法律多步因果推理基准上,CoEvo 使 8B LLM 能够维持自我进化,超越蒸馏基线和路径正确性方面最强的专有参考(82.1% vs. 71.4%)。经过训练的模型可以推广到看不见的类别和系统,从而保持根本原因的准确性。