论文

Workflow-R1:面向多轮工作流构建的组子序列策略优化

Workflow-R1: Group Sub-sequence Policy Optimization for Multi-turn Workflow Construction

模型训练强化学习Agentic RL

摘要

Agentic 工作流的快速发展证明了基于 LLM 的智能体在应对复杂推理任务上的强大性能。然而,现有工作流优化方法通常把工作流综合表述为静态的、一次性代码中心生成问题。这一范式对模型编码能力施加过多约束,限制了动态问题求解所需的灵活性。本文提出 Workflow-R1,一个把工作流构建重新表述为多轮的、基于自然语言的序贯决策过程的框架。为解决此类多轮交互中固有的优化粒度失配,我们提出组子序列策略优化(GSsPO)。GSsPO 虽显式贴合 Agentic 推理交错的 Think-Action 动态,但根本上是一个可泛化到广泛多轮 Agentic 序贯决策任务的结构感知 RL 算法。通过把优化单元重新校准到复合子序列——具体即原子 Think-Action 循环——它使梯度更新与这些交互的语义边界对齐,确保在复杂多轮推理任务中的稳健学习。在多个问答基准上的大量实验中,Workflow-R1 优于有竞争力的基线,验证了 GSsPO 作为序贯推理的通用方案,并确立了 Workflow-R1 作为自动化工作流优化的有前景新范式。

Workflow-R1:面向多轮工作流构建的组子序列策略优化
图4:Workflow-R1-Search(左,蓝色)与 Workflow-R1(右,黄色)的工作流构建可视化。