论文
Claw-R1:用于代理强化学习的阶梯级数据中间件系统
Claw-R1: A Step-Level Data Middleware System for Agentic Reinforcement Learning
摘要
代理强化学习(RL)已成为 后训练 的重要范例,用于将 LLM 从静态聊天机器人转变为交互式代理,从而催生了 OpenClaw 等代表性应用。现有工作主要关注同策略优化算法和训练框架,但很少关注智能体与环境交互的整个数据生命周期,从数据生产到训练消耗。为了弥补这一差距,我们推出了 Claw-R1,这是一种用于代理强化学习的交互式步骤级数据中间件系统。 Claw-R1 通过两个核心组件连接异构代理运行时和 RL 训练后端:网关服务器和数据池。网关服务器通过统一的 LLM API 入口点捕获多轮交互步骤,而数据池将它们组织成由提示 ID、响应 ID、奖励和其他元数据组成的步骤级记录。在我们的演示中,用户可以交互式地检查实时轨迹,检查每个步骤的状态、操作和奖励,按质量和准备情况整理数据,并为不同的下游 RL 算法配置训练就绪批次。总体而言,Claw-R1 将代理交互跟踪视为托管数据资产,而不是临时运行时日志。通过这次演示,我们希望鼓励社区认识到数据管理在代理强化学习中的重要性。我们的代码可在 https://github.com/AgentR1/Claw-R1 获取,演示视频可在链接 https://youtu.be/Pw47dAOw6B0 找到。