论文

TSPO:打破多轮搜索策略优化中的双重同质化困境

TSPO: Breaking the Double Homogenization Dilemma in Multi-turn Search Policy Optimization

模型训练强化学习RLVR

摘要

多轮工具集成推理使大语言模型(LLM)能够通过迭代信息检索来解决复杂的任务。然而,当前用于搜索增强推理的强化学习(RL)框架主要依赖于稀疏的结果级别奖励,导致“双重同质化困境”。这表现为(1)流程同质化,生成过程中涉及的思维、推理和工具被忽视。 (2)群体内同质化、粗粒度的结果奖励往往导致抽样过程中使用群体相对策略优化(GRPO)等方法评估群体内优势的效率低下。为了解决这个问题,我们提出了回合级阶段感知策略优化(TSPO)。 TSPO 引入了首次出现潜在奖励(FOLR)机制,将部分奖励分配给首次出现真实答案的步骤,从而保留过程级信号并增加组内的奖励方差,而无需外部奖励模型或任何注释。大量实验表明,TSPO 的性能显着优于最先进的基线,在 Qwen2.5-3B 和 7B 模型上分别实现了 24% 和 13.6% 的平均性能提升。

TSPO:打破多轮搜索策略优化中的双重同质化困境
图6:训练期间的响应长度演化。TSPO 变体在保持推理完整性的同时稳步缩减轨迹长度,避免了仅基于结果(outcome-only)的方法中出现的过早截断。