论文
TCPO:回合级贡献策略优化
TCPO: Turn-Level Credit Policy Optimization
摘要
验证器引导的多轮强化学习在每轮输出后提供评分,但当前输出质量分数不直接等于该轮对整个改进轨迹的贡献。TCPO构造回合级优势:回溯贡献衡量相对此前最佳状态的即时进展或退步;事后延迟贡献识别当下未改善却有后续收益的回合;对高惊异度回合,在固定历史下做选择性反事实估计。数学推理、代码生成和AppWorld实验显示,TCPO在不同模型规模、领域和验证器上改善或匹敌最强基线;Qwen3-4B与DeepSeek-R1-Distill-Llama-8B的最佳回合Pass@8为最好或并列最好,成功所需回合减少,多轮智能体表现提高。结果支持将评分转换为贡献作为多轮策略优化的重要组成。