论文
从学员到训练师:LLM 设计的多智能体推理 RL 训练环境
From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning
摘要
大语言模型 (LLM) 训练的强化学习管道通常依赖于阶段之间手动重新设计的环境,要求从业者启发式推断哪种配置最能改善当前策略。为了自动化这个过程,我们提出了 LLM-as-Environment-Engineer 框架,其中当前的策略模型分析故障轨迹以及上下文信息,并对下一阶段的训练环境配置提出修改建议。我们还推出了 MAPF-FrozenLake,这是一个可控测试平台,其生成器公开了多维环境配置,使其适合研究和基准测试环境重新设计。在此测试平台上,我们根据策略行为、故障案例和环境统计数据的结构化摘要对环境工程师进行调节,从中生成下一个训练阶段的配置。以 Qwen3-4B 作为骨干,我们的框架在基准测试中实现了最强的总体性能,优于更大的专有 LLM(例如 GPT、Gemini)和固定环境训练基准。我们进一步分析哪种形式的上下文最有效,发现成功的环境更新依赖于失败证据并保留已经有效的配置。有趣的是,当前的强化学习检查点比原始基础模型充当了更好的环境工程师,这表明策略学习提高了模型诊断其剩余弱点的能力。