技术实践

淘天用ROLL与直播仿真环境训练多Agent

模型训练智能体系统AI 基础设施强化学习奖励建模与过程监督Agent 协作分布式训练基础设施Agentic RL

概述

针对单 Agent 端到端 Agentic RL 多奖励混杂难收敛的问题,团队把工具调用模型与最终回复模型拆分为两个 Agent 做在线协同强化学习(Multi-Agent RL):工具调用模型在模拟直播互动环境中多轮交互,回复模型以其工具调用链为前缀生成回复,两者按各自奖励(回复侧正确性与帮助性加权、工具侧规则遵守与工具调用加权)分别计算组内优势并更新。 基于阿里自研 ROLL 框架搭建仿真环境,Rollout 用进程内 vLLM/Sglang、训练用 Megatron 后端,LLM Judge 打分并对非训练 token 做 mask。结果为回复模型相较 SFT 模型事实正确性提升 4.1pt、帮助性提升 23.6pt,工具调用模型工具调用合理性提升 18.2pt。 消融实验中相较固定工具调用模型仅 RLVR 的对照组,事实正确性 +5.6pt、帮助性 +6.6pt。