论文

基于信息增益的Rollout策略优化:多轮LLM智能体的自适应树结构Rollout方法

Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents

模型训练强化学习

摘要

强化学习已成为提升LLM智能体长程搜索任务能力的有前景范式——智能体须在收到最终结果前做出一系列中间决策。但既有方法仍有关键局限:rollout预算的分配常不显式评估中间状态的效用,大量计算可能花在低价值状态上——尽管不同分支的信息量差异巨大。本文提出基于信息增益的Rollout策略优化(IGRPO):把中间状态的信息量作为rollout收集的组织原则的策略优化框架。具体地,IGRPO执行预算感知的树结构rollout——按节点级信息量分配扩展预算,使更有信息量的分支被更频繁扩展、无前景分支被逐步抑制。我们进一步证明:信息增益驱动的rollout在轨迹上诱导显式的极限教师分布——自然产生清晰的政策优化目标——从而在单一框架内统一自适应树结构探索与有原则的策略学习。七个挑战性搜索增强QA基准上的实验显示:IGRPO在相同rollout预算约束下持续超越强基线——验证利用诱导教师分布指导长程搜索智能体策略优化的有效性。

基于信息增益的Rollout策略优化:多轮LLM智能体的自适应树结构Rollout方法:论文配图
图 1:不同推出模式的图示。红色节点代表无希望甚至误导的状态,绿色节点代表信息丰富的状态,灰色节点代表其他中间状态。左图:基于链的方法和现有的基于树的方法仍可能将探索预算分配给没有前途的节点。右:我们的方法采用基于信息增益的转出分配,优先扩展信息丰富的节点并减少对无前途分支的探索。