论文

多轮强化学习中稠密与稀疏信号的调和:面向工业销售智能体的双时程贡献归因

Harmonizing Dense and Sparse Signals in Multi-turn RL: Dual-Horizon Credit Assignment for Industrial Sales Agents

模型训练强化学习Agentic RL

摘要

为工业销售优化大语言模型需要在长期商业目标(如转化率)与流畅性、合规性等即时语言约束之间取得平衡。传统强化学习常把这些异质目标合并为单一奖励,导致高量级的会话级奖励淹没更细微的轮级信号,造成训练不稳定或奖励劫持。为解决该问题,我们提出双时程贡献归因(DuCA),一个在时间尺度上解耦优化的框架。其核心 Horizon-Independent Advantage Normalization(HIAN)在融合前分别对来自轮级与会话级奖励的优势进行归一化,确保即时与长期目标对策略更新的梯度贡献均衡。基于高保真用户模拟器的大量实验显示,DuCA 超越最先进的 GRPO 基线:转化率相对提升 6.82%,句间重复减少 82.28%,身份被识别率降低 27.35%,表明其在有效平衡策略表现与自然语言生成双重需求的工业销售场景上取得显著改进。

多轮强化学习中稠密与稀疏信号的调和:面向工业销售智能体的双时程信用分配
图2:DuCA框架概览。系统通过一个以人设(persona)和历史为条件的用户模拟器生成交互轨迹。系统独立地计算并归一化:(1) 来自密集启发式约束的轮次级优势,以及 (2) 来自稀疏业务结果的会话级优势。这些解耦的信号被融合,为稳健的策略更新提供平衡的最终优势。