论文
链上推理,树上学习:面向多轮智能体策略优化的自我纠正与嫁接
Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization
摘要
大语言模型智能体的强化学习在多步推理任务中常受稀疏奖励的阻碍。群体相对策略优化(GRPO)等现有方法将采样轨迹视为独立的链,对每条链中的所有步骤赋予统一信用,忽视了可能对推理结果产生不成比例影响的关键步骤的存在。本文提出T-STAR(Tree-structured Self-Taught Agent Rectification),一个能跨看似独立的轨迹恢复潜在相关奖励结构的框架。具体而言,我们通过识别并合并功能相似的步骤/节点,将各轨迹整合为一棵统一的认知树(Cognitive Tree)。它启用了一种内省估值(Introspective Valuation)机制,将轨迹级奖励沿树反向传播,从而获得一种方差缩减的步骤级相对优势的新概念。利用认知树,我们还开发了上下文思维嫁接(In-Context Thought Grafting),通过在关键分歧点/步骤处对比成功与失败分支来合成纠正性推理。我们提出的手术式策略优化(Surgical Policy Optimization)随后通过一种Bradley-Terry类型的手术式损失,利用集中在这些关键点/步骤上的丰富策略梯度信息。在具身、交互、推理和规划基准上的大量实验表明,T-STAR相较强基线取得了一致的改进,且在需要长推理链的任务上收益最为显著。
