论文
用于循证推理的反事实自我进化Agent
Counterfactual Self-Evolving Agents for Evidence-Grounded Reasoning
摘要
自对弈提议者-求解器方法通过生成任务并从经过验证的解决方案中学习来改进推理。然而,对于证据可识别的任务,特定案例的证据和领域知识决定了可检查的答案,自我博弈需要生成可信的案例,其答案可以被独立验证。我们引入反事实自我进化,它生成反事实背景以重新考虑原始情况。可训练的提议者构建有针对性的证据编辑,并通过因果解释描述潜在的结果变化。我们手工制作一个经过专家验证的反事实指令调整数据集,以教导提案者在广泛的行动结果场景中生成高质量的反事实。每个反事实指令调整示例都指定了定义类别内的编辑,并解释了其对决策的假设因果影响,教导提案者系统地推理哪些变化以及原因。我们根据这些例子对提议者进行指令调整,然后综合来自求解器和验证者的反馈制定微调奖励。在不同的反事实场景中,这种奖励有利于高质量的反事实和必要的修改,同时惩罚推翻正确决策的变化。反事实背景旨在纠正错误并增强对正确决策的信心。接受的反事实在记忆中积累,为冻结的求解器提供上下文证据;求解器通过不断变化的上下文而不是权重更新来适应。我们将该框架应用于临床推理、事实验证和商业推理。随着反事实记忆的增长,我们的评估会跟踪连续几轮的表现,包括转移到更困难的情况。我们的方法在不同的前沿模型中取得了优异的结果。