论文

AutoSaddler:从智能体执行轨迹获得持久更新以自动优化Harness

AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces

智能体系统Agent Harness智能体自我改进

摘要

LLM智能体在长视界任务上仍不可靠,微小的局部失败会在长时间交互中累积并导致整体任务失败。尽管外部harness能显著提升鲁棒性,harness设计仍是手动且昂贵的过程,需要在提示、工具配置和控制逻辑构成的大空间中搜索。我们提出AutoSaddler,一个自动harness优化框架,它将harness改进形式化为离线学习问题,并利用来自小批量的失败信号迭代更新harness。AutoSaddler结合了失败轨迹诊断、将harness视为代码的结构化补丁生成,以及基于验证的更新选择。在GAIA2、SWE-Bench Pro和Terminal-Bench 2.0上的实验表明,AutoSaddler相对相应的基础harness大幅提升智能体性能,分别取得9.0、9.6和10.0个百分点的增益。消融研究进一步表明,有效的harness优化受益于三个要素:深度调试而非浅层反思、有针对性的修改而非无约束编辑,以及考虑泛化的选择而非针对特定轨迹的修复。这些结果共同表明,自动harness优化是通向更高性能、更可靠智能体系统的一条有希望的道路。

AutoSaddler:从智能体执行轨迹获得持久更新以自动优化Harness:论文配图
图2:AutoSaddler 概览。迭代优化循环:当前 harness 在小批量上进行测试,跨 harness 组件进行诊断与修补,验证改进,然后反思并将经验教训提取到 EvoDAG 中,由其指导下一个 harness 的演化。