论文

RISED:Agentic 多环境选择和自蒸馏的评分标准

RISED: RubrIcs for agentic multi-environment Selection and sElf-Distillation

模型训练强化学习Agentic RL

摘要

作为通才Agent的途径,在不同的交互环境中联合训练单个 LLM Agent已引起越来越多的关注。现有的课程和数据选择策略通常在环境级别分配训练或优先考虑基于本地奖励的信号,而没有明确考虑当前跨环境rollout之间的关系以进行提示组选择。同时,由于环境以不同的速率学习,所有失败和所有成功的部署组可以在一个批次中共存,从而使这些数据没有与组相关的奖励信号。这两项挑战都凸显了多环境强化学习中仅依赖标量奖励的局限性:它们提供的有关跨环境关系的信息有限,并且当奖励相同时,没有组内奖励对比。这会激发更丰富的文本反馈,例如描述rollout行为的标题,以指导学习。除了将评分标准用作奖励之外,我们还重新利用评分标准来指导在线数据选择和政策监督。大语言模型评审使用跨环境共享的预定义标题词汇来标记每次部署。生成的配置文件指导选择与混合环境批次的整体行为组成相一致的数据,同时限制与已选择的数据的重叠。可用的积极评价标准(描述期望的行为)为政策自我蒸馏教师提供了特权背景,提供额外的词元级监督,而消极评价标准(描述不良行为)指导后续的rollout一代远离反复出现的失败模式。这些组件共同构成了 RISED。在各个模型主干中,RISED 在各个环境中实现了最高的平均通过率,并且在每个单独环境中排名第一或第二。基于评分标准的 RISED 分析可以进一步描述伴随这些收益而来的行为变化。