论文
Ecdysis:LLM 代理运行时Harness的高效且有效的训练
Ecdysis: Efficient and Effective Training of Runtime Harnesses for LLM Agents
摘要
自进化运行时工具可以显着提高 大语言模型 (LLM) 代理的功能,并为优化代理执行提供有前途的范例。现有的故障驱动方法通常将观察到的代理故障视为Harness修改的直接证据。故障驱动的Harness演化的一个关键挑战是观察到的故障可以反映基础模型的局限性或Harness的系统缺陷。因此,直接针对个体故障进行优化可能会导致特定于模型的适应,并损害跨任务和模型的泛化能力。我们研究跨任务实例积累的失败证据是否可以为Harness训练提供更可靠的信号。我们的主要见解是,与孤立的故障相比,在不同任务中重复出现的故障为系统性Harness缺陷提供了更强有力的归纳证据。基于这一见解,我们提出了 Ecdysis,它在将重复出现的故障模式提升为持久性Harness进化之前,聚合了任务实例中的故障证据,使进化偏向于更可能泛化到个体模型行为之外的修复。 Ecdysis 进一步采用协作故障分析来完善修改规范,用额外的进化时间推理来提高修改质量。在多个 LLM 和基准测试中,Ecdysis 将进化Harness的推理准确性比现有Harness进化提高了 18.56%,同时将Harness训练速度提高了 1.84 倍。 Ecdysis 还可以实现更高效的数据训练。细粒度分析表明,Ecdysis 减少了进化过程中特定于模型的适应性,而由此产生的工具表现出更强的跨 LLM 泛化性和更低的推理时间词元消耗。