论文
Evo-Harness:面向自进化智能体的上下文到Harness技能编译
Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents
摘要
从经验中学习对于开发能力强、可自我改进的大语言模型(LLM)智能体至关重要。现有方法通常通过反思、记忆、规则或技能从积累的轨迹中提取知识。然而,现实环境中的智能体会持续遇到新任务,往往只有一次改进机会。这些执行产生了丰富但噪声极大的上下文,把广泛有用的经验与任务特定产物纠缠在一起。关键的是,先前的工作很少在复杂的真实世界任务上验证其有效性,或分离出改进的底层驱动因素。为填补这些空白,我们提出在线harness学习(online harness learning)这一表述:一个冻结的智能体通过在连续任务中不断更新结构化harness来改进。这一表述借助我们提出的Evo-Harness,实现对关键自我改进因素的系统性研究。其核心是上下文到harness的技能编译(context-to-harness skill compilation),把噪声大的一次性执行提炼为可复用的技能harness,用于跨领域和主题级适配。为证明一次性技能编译的效力,我们在五个真实世界基准(TerminalBench2、SWE-bench、CL-Bench、-bench、WebArena-Infinity)上进行了评估。大量分析证明了Evo-Harness的有效性,并为LLM智能体如何有效即时学习提供了有原则的理解。代码见 https://github.com/A-EVO-Lab/a-evolve/tree/release/evo-harness。
