论文
ToolRLA:特定领域代理中工具集成强化学习对齐的细粒度奖励分解
ToolRLA: Fine-Grained Reward Decomposition for Tool-Integrated Reinforcement Learning Alignment in Domain-Specific Agents
摘要
工具集成的推理代理将自然语言审议与外部 API 调用交织在一起,有望完成复杂的多步骤任务。然而,将此类代理调整为高风险的特定领域部署具有挑战性,因为现有的强化学习使用粗略的二元奖励(成功/失败),不足以指导生产中细致入微的工具调用。我们提出了 ToolRLA,这是一个针对特定领域工具集成代理的三阶段训练后管道(监督微调、组相对策略优化、直接偏好优化)。其核心是具有乘法正确性分解的细粒度奖励函数,从四个维度评估工具调用:格式有效性、工具选择正确性、调用效率和领域约束合规性。乘法组合优先考虑正确的工具选择(有意义的参数评估的先决条件),而较大的负合规性惩罚({\lambda}=10)确保遵守法规。 ToolRLA 部署在现实世界的财务咨询副驾驶(80 多个顾问、1,200 多个每日查询、15 个以上异构 API)上,端到端任务完成率提高了 47%(62% 到 91%),工具调用错误降低了 63%(38% 到 14%),监管违规率降低了 93%(12% 到 0.8%),并且三个月后延迟低于 2 秒。消融研究证实,细粒度奖励分解比粗粒度奖励分解贡献了 7 个百分点;通用性在 ToolBench 和 API-Bank 上得到验证。
