论文

面向多智能体编排的奖励建模

Reward Modeling for Multi-Agent Orchestration

模型训练智能体系统奖励建模与过程监督Agent Harness

摘要

基于大型语言模型 (LLM) 构建的多代理系统 (MAS) 需要有效的编排来协调专门的代理,但训练此类编排器却受到有限的监督和高计算成本的阻碍。我们提出了编排奖励模型(OrchRM),这是一个自我监督的框架,用于评估编排质量,无需人工注释。 OrchRM 利用多代理执行的中间工件来构建 Bradley-Terry 奖励模型训练的输赢对。与依赖昂贵的子代理部署的现有 MAS 测试时间扩展和编排器培训框架不同,OrchRM 直接在编排级别运行,从而实现高效且高性能的奖励引导编排器培训和 MAS 测试时间扩展。 OrchRM 将令牌使用的训练效率提高了高达 10 倍,同时将 MAS 测试时间扩展性能的准确性提高了高达 8%。这些收益一致地跨多个领域转移,包括数学推理、基于网络的问答和多跳推理,证明编排级奖励模型是强大的多代理编排的可扩展方向。代码可在 https://github.com/Wang-ML-Lab/OrchRM 获取。