论文
多轮强化学习中稠密与稀疏信号的调和:面向工业销售智能体的双时程贡献归因
Harmonizing Dense and Sparse Signals in Multi-turn RL: Dual-Horizon Credit Assignment for Industrial Sales Agents
摘要
为工业销售优化大语言模型需要在长期商业目标(如转化率)与流畅性、合规性等即时语言约束之间取得平衡。传统强化学习常把这些异质目标合并为单一奖励,导致高量级的会话级奖励淹没更细微的轮级信号,造成训练不稳定或奖励劫持。为解决该问题,我们提出双时程贡献归因(DuCA),一个在时间尺度上解耦优化的框架。其核心 Horizon-Independent Advantage Normalization(HIAN)在融合前分别对来自轮级与会话级奖励的优势进行归一化,确保即时与长期目标对策略更新的梯度贡献均衡。基于高保真用户模拟器的大量实验显示,DuCA 超越最先进的 GRPO 基线:转化率相对提升 6.82%,句间重复减少 82.28%,身份被识别率降低 27.35%,表明其在有效平衡策略表现与自然语言生成双重需求的工业销售场景上取得显著改进。
