论文
CM2:以清单奖励进行多轮多步Agentic工具使用的强化学习
CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use
摘要
AI智能体日益被用于通过多轮用户交互推理并调用外部工具来解决现实任务。然而,将强化学习应用于此类设置仍然困难:现实目标常常缺乏可验证奖励,转而强调开放式行为;此外,针对多轮、多步Agentic工具使用的RL仍未被充分探索;而且构建和维护可执行工具环境成本高昂,限制了规模与覆盖面。我们提出CM2,一个用清单奖励替代可验证结果奖励的RL框架。CM2将每一轮的预期行为分解为带明确证据锚定和结构化元数据的细粒度二元判据,把开放式评判转变为更稳定的分类式决策。为平衡稳定性与信息量,我们的方法采用稀疏奖励指派但密集评估标准的策略。训练在可扩展的LLM模拟工具环境中进行,避免为大型工具集付出沉重工程代价。实验表明,CM2持续优于监督微调。从8B Base模型出发、在8k样本的RL数据集上训练,CM2相对SFT对应模型在tau^-Bench上提升8分,在BFCL-V4上提升10分,在ToolSandbox上提升12分。结果与同等规模的开源基线相当甚至更优,包括评判模型。因此,CM2提供了一个不依赖可验证奖励来优化多轮、多步工具使用智能体的可扩展配方。代码由开源社区提供:https://github.com/namezhenzhang/CM2-RLCR-Tool-Agent 。
