论文

CacheRL:利用缓存轨迹与混合奖励训练多轮工具调用智能体

CacheRL:Multi-Turn Tool-Calling Agents via Cached Rollouts and Hybrid Reward

模型训练强化学习

摘要

我们推出了 CacheRL,这是一个用于训练小型代理基础模型的系统,它在多步骤工具调用任务上实现了 92% 的处理准确性,接近 GPT-5 的 94%,同时所需的计算量减少了 100 倍。我们的方法解决了实际代理训练中的三个挑战:大规模从大型模型转移工具调用知识,无需昂贵的实时工具执行即可实现强化学习,以及从嘈杂的缓存环境中稳健地学习。 CacheRL 引入了三项关键创新。首先,混合思维轨迹管道通过 LLM 生成的推理轨迹增强代理轨迹,生成训练示例,不仅教会模型调用什么工具,还教模型调用什么工具。其次,CacheAgentLoop 通过三层模糊缓存消除实时执行成本,同时使用 词元级 掩码保持轨迹保真度。第三,缓存层感知奖励动态调整答案质量权重,以避免因缓存引起的限制而惩罚模型。通过迭代监督 微调 (SFT) 和组相对策略优化 (GRPO),CacheRL 将 Qwen3-4B-Thinking 的验证奖励从 0.43 提高到 0.78。在公共代理工具调用基准上,我们的模型实现了与 GPT-5 等前沿模型相比的竞争性能。消融研究表明,消除知识转移会使性能降低 41%,而缓存感知奖励则可提高 17%。有趣的是,强化学习提高了训练稳定性,但除了强监督 微调 之外,其收益有限,这表明数据质量和奖励设计在构建实用的小代理模型中比复杂的优化方法发挥着更重要的作用。