论文
T²PO:不确定性引导的探索控制,面向稳定的多轮智能体强化学习
T$^2$PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning
摘要
多轮强化学习(RL)的最新进展显著提升了推理LLM在复杂交互任务上的表现。尽管有细粒度贡献归因与轨迹过滤等稳定化技术,不稳定仍普遍存在并常导致训练崩溃。我们认为这种不稳定源于多轮 setting 中的低效探索:策略持续产出既不降低不确定性也不推进任务的低信息量动作。为此我们提出Token与Turn级策略优化(T²PO),一个显式在细粒度层面控制探索的不确定性感知框架。token层面,T²PO监测不确定性动态,当边际不确定性变化低于阈值时触发思考干预。回合层面,T²PO识别探索进展可忽略的交互并动态重采样这些回合,避免浪费rollout。我们在WebShop、ALFWorld与Search QA等多种环境中评估T²PO,展示其在训练稳定性与性能上的大幅提升以及更优的探索效率。代码见 https://github.com/WillDreamer/T2PO。
