论文
LLMZero:通过 LLM 代理发现 RL 后训练 的自适应训练策略
LLMZero: Discovering Adaptive Training Strategies for RL Post-Training via LLM Agents
摘要
RL 后训练 策略依赖于数据集,并揭示了一种反复出现的经验模式:容量参数在各个阶段单调累积,而正则化参数主要随着训练动态的变化而振荡。这种区别凸显了固定训练计划中的一个潜在缺陷:通过强制所有参数沿着严格的路径前进,它们无法捕获正则化必须跟踪的动态探索-利用权衡。我们通过 LLMZero 发现了这一点,这是一个代理系统,通过诊断每个检查点的病理并提出协调的多参数转换,通过树搜索来优化训练轨迹。在四个不同的 GRPO 任务中,LLMZero 发现了一些策略,这些策略比基本模型提高了 9% 到 140%,比网格搜索提高了 6% 到 15%(相对),在匹配的计算预算下始终优于随机搜索和基于技能的代理。容量-正则化不对称性在所有四个任务中都是一致的,为多阶段训练提供了候选设计启发式。