论文
E3-TIR:面向工具集成推理的增强式经验利用
E3-TIR: Enhanced Experience Exploitation for Tool-Integrated Reasoning
摘要
尽管大语言模型(Large Language Models, LLM)已在工具集成推理(Tool-Integrated Reasoning, TIR)中展现出显著潜力,现有训练范式仍面临明显局限:Zero-RL因缺乏先验引导而饱受探索低效与模式退化之苦,而SFT-then-RL则受制于高昂的数据成本以及由低熵坍缩导致的能力平台期。为应对这些挑战,我们提出E3-TIR(Enhanced Experience Exploitation,增强式经验利用),一种面向智能体训练早期阶段的预热范式。具体而言,我们将训练形式化为三种经验类型的动态整合:专家前缀(Expert Prefixes)、专家引导(Expert Guided)与自我探索(Self-Exploration)。通过围绕专家“锚点”执行多样化的分支探索,并采用混合策略优化机制,我们有效缓解了分布偏移,并解决了由共享前缀引发的优化冲突。我们的方法动态调整模型的知识边界,有效平衡探索多样性与训练效率。实验结果表明,E3-TIR在工具使用任务上较传统范式实现6%的性能提升,同时所需合成数据不足10%。此外,在ROI——一个综合性能、数据成本与训练效率的综合指标——方面,我们相较基线取得1.46倍的增益。代码可在 https://github.com/yuki-younai/E3-TIR 获取。
