论文
CIPO:自适应工具粒度选择的反事实想象策略优化
CIPO: Counterfactual Imagination Policy Optimization for Adaptive Tool Granularity Selection
摘要
大语言模型 (LLM) 智能体通过与外部工具的多步骤交互来解决复杂的任务。这些交互通常包含重复出现的本地工具序列。将此类序列视为复合“技能”可以缩短工具使用轨迹并减少重复的低级决策。然而,当原子工具和复合技能共存时,技能使用就变成了一个策略问题:智能体必须决定当前状态是否需要原子精细控制或技能级抽象。在本文中,我们认为有效的技能使用应该作为自适应工具粒度选择来研究。对于这个问题最直接的训练信号是比较同一状态下可用的原子和技能选择的后果。基于这一观点,我们提出了 CIPO,一个用于自适应工具粒度的反事实想象策略优化框架。 CIPO 通过在预算有限的情况下挖掘成功的工具使用轨迹来构建可执行技能,并使用反事实分支执行轨迹训练粒度决策。对于每个基本执行轨迹,CIPO 在第一个合格的粒度决策上分支,并用可行的原子或技能替代方案替换所选操作。配对结果差异作为策略优化的补充奖励。跨多个基准和模型骨干模型的实验表明,CIPO 比基准提高了任务成功率和决策效率。进一步的分析表明,CIPO 通过根据当前状态改进原子工具和复合技能之间的选择来学习有效的技能使用,而不是简单地增加技能频率。
