论文
SLCA-GRPO:解决工具调用强化学习中的跨段信用误归因
SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL
摘要
工具调用Agent产生异构输出,将结构化工具调用与面向用户的自然语言总结交织在一起。这种输出异构性在标准的同策略强化学习(RL)中呈现一种结构性失败模式:GRPO等算法不加区分地向所有token广播同质的轨迹级标量优势。结果,来自总结生成的梯度噪声渗入工具决策token,造成跨段信用误归因与脆弱的优化。本工作中,我们提出SLCA-GRPO,一个融合分段锁定信用分配(SLCA)的框架。为了在没有昂贵真实API的情况下实现可扩展探索与稳定训练,我们首先构建Schema引导的LLM模拟器(SGLS)作为基础训练基础设施。在此基础上,SLCA在单组rollout内以结构段级别解耦优势估计,无需从中间状态进行额外rollout。在层次化奖励(HierR)的支持下,SLCA将执行优势路由到工具token,将偏好优势路由到总结token,在每次策略更新内消除优势污染(主要的跨段信用误归因通道)。在7B骨干上,SLCA-GRPO在相同训练预算下加速收敛,并超过标准GRPO、ToolPO与RLTR:域内评测+2.53个百分点,Berkeley Function-Calling Leaderboard(BFCL)上+1.36个百分点,$\tau^2$-Bench上+9.15个百分点,以更低的工具冗余与成本取得更高准确率。
