论文

SLCA-GRPO:解决工具调用强化学习中的跨段信用误归因

SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL

模型训练强化学习RLVRAgentic RL

摘要

工具调用Agent产生异构输出,将结构化工具调用与面向用户的自然语言总结交织在一起。这种输出异构性在标准的同策略强化学习(RL)中呈现一种结构性失败模式:GRPO等算法不加区分地向所有token广播同质的轨迹级标量优势。结果,来自总结生成的梯度噪声渗入工具决策token,造成跨段信用误归因与脆弱的优化。本工作中,我们提出SLCA-GRPO,一个融合分段锁定信用分配(SLCA)的框架。为了在没有昂贵真实API的情况下实现可扩展探索与稳定训练,我们首先构建Schema引导的LLM模拟器(SGLS)作为基础训练基础设施。在此基础上,SLCA在单组rollout内以结构段级别解耦优势估计,无需从中间状态进行额外rollout。在层次化奖励(HierR)的支持下,SLCA将执行优势路由到工具token,将偏好优势路由到总结token,在每次策略更新内消除优势污染(主要的跨段信用误归因通道)。在7B骨干上,SLCA-GRPO在相同训练预算下加速收敛,并超过标准GRPO、ToolPO与RLTR:域内评测+2.53个百分点,Berkeley Function-Calling Leaderboard(BFCL)上+1.36个百分点,$\tau^2$-Bench上+9.15个百分点,以更低的工具冗余与成本取得更高准确率。

SLCA-GRPO:解决工具调用强化学习中的跨段信用误归因:论文配图
图 1:SLCA-GRPO 框架概览。(上)基础设施:SGLS 通过模式约束的仿真实现可扩展探索,生成交错的轨迹。(中)信号:HierR 将反馈解耦为密集的执行奖励 R(tool) 与终端结果奖励 R(sum)。(下)优化:SLCA 解耦分段优势,通过独立地归一化并路由优势(Â(tool) 与 Â(sum)),在每个策略更新内阻断已定义的“摘要到工具”支持路径。