论文

OpenTinker:Agentic强化学习中的关注点分离

OpenTinker: Separating Concerns in Agentic Reinforcement Learning

AI 基础设施模型训练强化学习AI 开发与运维平台Agentic RL

摘要

我们引入了 OpenTinker,这是一种大语言模型 (LLM) 代理的强化学习 (RL) 基础设施,围绕算法设计、执行和代理与环境交互的关注点分离而构建。 OpenTinker 不依赖单一的、端到端的 RL 管道,而是将代理学习系统分解为具有明确定义的抽象边界的轻量级、可组合组件。用户指定代理、环境和交互协议,而推理和训练则委托给托管执行运行时。 OpenTinker 引入了一个集中式调度程序,用于管理训练和推理工作负载,包括基于 LoRA 的全参数 RL、有监督的微调和共享资源上的推理。我们进一步讨论将 OpenTinker 扩展到多智能体训练的设计原则。最后,我们提出了一组 RL 用例,展示了该框架在实际代理学习场景中的有效性。

OpenTinker:Agentic强化学习中的关注点分离
图1:OpenTinker 架构。Scheduler 负责统筹资源分配,Task Servers 执行训练/推理作业。Client 是用于定义与监控的轻量级接口。