论文
用过程奖励扩展多智能体系统
Scaling Multiagent Systems with Process Rewards
摘要
虽然多智能体系统已展现出通过分工处理复杂任务的前景,但同时微调多个智能体面临两个关键挑战:(1)跨智能体的贡献归因,以及(2)昂贵多智能体回放的样本效率。本工作提出用来自AI反馈的逐动作过程奖励微调多智能体系统(MAPPA)来同时应对两者。通过把贡献归因给单个智能体动作而非仅在任务完成时,MAPPA在无真值标签的情况下实现细粒度监督,同时从每次回放中提取最大训练信号。我们在竞赛数学题与工具增强数据分析任务上展示该方法。在未见数学题上,MAPPA在AIME上取得+5.0--17.5pp、在AMC上取得+7.8--17.2pp;对数据分析任务,该方法将成功率提升+16.7pp,质量指标最高提升47%,验证了逐动作监督能在不同领域带来跨多智能体系统的改进。通过应对这些挑战,本工作向以最少人工监督扩展多智能体系统以处理复杂长时程任务迈出第一步。
