论文

IAPO:多轮服务代理中信用分配的影响感知策略优化

IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents

模型训练强化学习Agentic RL

摘要

大语言模型 (LLM) 代理越来越多地通过与用户和外部工具的多轮交互来解决长期任务。在这些设置中,相关任务信息通常会随着时间的推移而展开,而不是在初始提示时完全指定。服务代理使这一挑战变得特别具体:用户可以澄清或修改他们的目标,而工具响应则提供后续决策所需的信息。因此,仅最终奖励并不能表明哪些行为有助于解决任务。最近的方法依赖于其他轨迹或重采样延续的比较证据,或依赖于单独构建的步骤级学习信号来完善信用。然而,完整执行轨迹已经记录了信息和错误如何在代理操作之间流动。我们引入了影响感知策略优化(IAPO),它将每条执行轨迹表示为可训练代理操作的类型化影响依赖图,并以用户和工具观察作为证据。 IAPO 将支持使用和失败使用结构转换为路由权重,重新分配相同的轨迹级优势。使用 Qwen3-4B 和 Qwen3-8B 进行的实验表明,在三个服务代理基准测试中,Qwen3-4B 和 Qwen3-8B 的性能优于多轮强化学习 (RL) 基线:${τ^2}$-Bench、UserBench 和 AgentChangeBench。 BFCL-v4 Multi-Turn 进一步表明,这些增益不会影响多轮函数调用性能。这项工作增进了对多轮用户交互中信用分配的理解,并提供了一种从稀疏结果反馈中训练服务代理的原则方法。