论文
EvoIn:连接进化和内化以进行Agent微调
EvoIn: Bridging Evolution and Internalization for Agent Fine-Tuning
摘要
近期研究通过共同演进Harness和模型改进Agent,但常把新工具、新决策程序以及模型对演进后Harness的适配混在一起,统称为Agent改进。本文专门研究Agent如何改进决策程序,提出连接演进与内化的微调框架EvoIn。EvoIn首先分析执行轨迹,在Harness中临时实例化新的决策程序,对其进行演进和验证。通过验证的程序引导Agent生成更好的推理轨迹,随后将其重写为自包含轨迹:移除对Harness指令的显式引用,把所诱导的决策逻辑表达为模型自身的推理。最后,EvoIn用重写轨迹微调模型,将程序内化,使改进后的决策在推理时不依赖演进后的Harness也能持续存在。多种基准上的评估表明,EvoIn持续帮助Agent学习更强的决策程序,域内通过率提高10.9个百分点,域外提高9.2个百分点。内化后的程序还可泛化至未见任务。案例显示,Agent能在解题前决定解题方式,例如先查看文档长度,再选择全文阅读或检索。该方法在另一模型家族上也获得一致改善。