论文

针对主动用户的隐式回合策略优化-LLM 交互

Implicit Turn-Wise Policy Optimization for Proactive User-LLM Interaction

模型训练奖励建模与过程监督

摘要

多轮人机协作是部署自适应辅导、对话式推荐和专业咨询等交互式服务的基础。然而,可验证的中间奖励的稀疏性和用户响应的高随机性阻碍了通过强化学习优化这些交互。为了应对这些挑战,我们引入了隐式回合策略优化(ITPO)。 ITPO 利用隐式过程奖励模型从稀疏的结果信号中获取细粒度、轮流的过程奖励。与不稳定的 词元级 奖励不同,这些回合级信号表现出卓越的鲁棒性,并且可以利用标准化机制来进一步增强训练稳定性。我们通过三个具有代表性的多回合协作任务来评估 ITPO:数学辅导、文档写作和医疗推荐。经验结果表明,ITPO 与 PPO、GRPO 或 RLOO 结合使用时,始终能够比现有基线实现更高的收敛性。详细的轨迹分析证实,ITPO 推断出在语义上与人类判断一致的回合偏好。代码可在 https://github.com/Graph-COM/ITPO 上公开获取。