论文

Living-Harness 是一个交互式代理进化者

Living-Harness Is an Interactive-Agent Evolver

智能体系统Agent Harness

摘要

大语言模型 (LLM) 代理可以从情节内或重试后的故障中恢复,但相同的执行失败可能会在以后的任务中重复出现,因为情节后反馈很少修改指导未来交互的持久性工具。静态Harness通过固定工具、上下文、内存和工作流结构提高可靠性,但在部署后保持不变。我们提出 $\textbf{Living-Harness}$,一种自我进化的代理Harness,它将每个完成的轨迹及其评估器信号转换为有界Harness更新的后验证据。在域级 $\textbf{Evolution-SOP}$ ($\textbf{S}$tandard $\textbf{O}$perating $\textbf{P}$rocedure) 的指导下,Living-Harness 提取情景抽象和结构化更新证据,并编写两种互补形式的过程知识:记录触发条件、故障模式和恢复操作的情景记忆,以及记录状态节点、修复边和转换的状态图规则。检索更新的Harness状态以指导未来的交互,同时工具和基础上下文保持冻结,从而允许程序修复在进化周期中累积。在源自 $τ^2$-Bench 和 MultiWOZ-2.4 的八个交互式环境中,Living-Harness 将平均 Pass@1 相对于最强交互式基线分别提高了 10.07 和 9.91 个百分点,并支持跨模型主干仅检索重用演进的Harness状态。我们的代码将很快在 https://github.com/anotherbricki/Living-Harness 上公开发布。