论文

ASCT:在 Agentic 强化学习中仔细搜索用于信用分配的反事实树

ASCT: Attentive Search over Counterfactual Trees for Credit Assignment in Agentic Reinforcement Learning

模型训练强化学习Agentic RL

摘要

终局效用评估完整的 agentic 工作流程,但学习需要对其中的决策给予认可。我们引入了反事实树上的注意力搜索(ASCT),这是一个将训练时的多步骤搜索转化为本地行动信用的框架。在actor访问的状态下,辅助树评估来自相同可恢复前缀的其他合法动作。其动作值表以冻结actor的概率为中心,并为actor采样轨迹上的 PPO 提供信用。该协议将反事实评估与策略学习联系起来,同时单独部署actor。 Uniform、UCT 和成本感知 AgentUCT 实例化了框架。在 HotpotQA agentic 检索增强生成上,所有三者都比轨迹返回 PPO 和工作流程适应的 VinePPO 提高了留出集上的平均效用。在三个种子中,ASCT-AgentUCT 的效用达到 0.6187,而 VinePPO 的效用为 0.5939,答案F1和执行成本表现得到改善,并且使用记录的辅助 Qwen 词元减少了 50.3%。迁移和组件描述研究检查了培训环境之外学到的策略。