论文
基于信息增益的Rollout策略优化:多轮LLM智能体的自适应树结构Rollout方法
Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents
摘要
强化学习已成为提升LLM智能体长程搜索任务能力的有前景范式——智能体须在收到最终结果前做出一系列中间决策。但既有方法仍有关键局限:rollout预算的分配常不显式评估中间状态的效用,大量计算可能花在低价值状态上——尽管不同分支的信息量差异巨大。本文提出基于信息增益的Rollout策略优化(IGRPO):把中间状态的信息量作为rollout收集的组织原则的策略优化框架。具体地,IGRPO执行预算感知的树结构rollout——按节点级信息量分配扩展预算,使更有信息量的分支被更频繁扩展、无前景分支被逐步抑制。我们进一步证明:信息增益驱动的rollout在轨迹上诱导显式的极限教师分布——自然产生清晰的政策优化目标——从而在单一框架内统一自适应树结构探索与有原则的策略学习。七个挑战性搜索增强QA基准上的实验显示:IGRPO在相同rollout预算约束下持续超越强基线——验证利用诱导教师分布指导长程搜索智能体策略优化的有效性。
