论文

AdaptEvo:具有不断发展的监督的自适应代理学习

AdaptEvo: Adaptive Agent Learning with Evolving Supervision

模型训练智能体系统强化学习奖励建模与过程监督智能体自我改进

摘要

规则控制的上下文决策任务需要模型将指定的规则应用于特定案例的上下文和证据。书面规则可能会在决策指导和过程评估方面留下空白,而参考判断则在规则和证据的支持方面有所不同。为了应对这些挑战,我们引入了 AdaptEvo,这是一个在不完善监督下学习的框架,它将置信自适应策略优化与不断发展的决策知识和评估规则结合起来。其训练模块使用置信度自适应 GRPO (CA-GRPO) 根据参考置信度来平衡结果和过程奖励。其进化模块从训练案例中反复出现的故障中合成可重用的决策知识,并细化流程规则以检测被忽视的错误。为了支持实证评估,我们构建了一个工业多模式内容审核数据集,包括训练集以及期内和期外测试集,后者是根据更改的规则收集的。使用 Qwen3.6-35B-A3B,AdaptEvo 实现了 61.9% 的精确标签准确度和 72.2% 的二元决策准确度 期内,分别超出 GRPO 7.5 和 3.7 个百分点。在期外,使用 CA-GRPO 训练的策略在没有注入决策知识的情况下,在评估的检查点上保留了相对于基本模型的精确标签准确性增益,而 GRPO 会随着继续训练而下降。 CA-GRPO 在两个期外指标上也优于经过测试的固定奖励混合物。