论文

EvoHarness-RL:用于长视野 LLM 代理的学习自我进化运行时框架

EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents

智能体系统Agent Harness

摘要

长期 LLM 代理越来越依赖外部执行支持来维护状态、跟踪进度、调用工具、验证结果以及跨交互重用经验。然而,有效的利用带来了两个耦合的挑战:从嘈杂的交互跟踪中形成状态以及对外部状态访问的运行时控制。现有代理通常通过提示、启发式或特定于域的约定来处理这两者,而将外部工作区及其使用策略留给手动设计。为了解决这个问题,我们研究了Harness策略学习的问题,其中代理离线学习Harness策略并部署它们以在运行时任务执行期间在线构建和更新外部Harness状态。我们引入了 EvoHarness-RL,它将信念、进步和经验 (BPE) 公开为面向策略的Harness状态。受监督的Harness 微调 向基础代理传授Harness动作空间以及如何构建有用的外部状态,而具有成本意识的 GRPO 则探索协调策略,以在长范围交互期间选择性地读取、更新和巩固该状态。使用 Qwen3-8B LLM 在 ALFWorld 上实例化,EvoHarness-RL 达到了 96.9% 的成功率,并揭示了两个关键动态:Harness退火,其中训练将重复的Harness使用模式内化到模型策略中,并将代理从频繁的Harness调用转向选择性外部状态访问;以及Harness进化,其中进度更新和经验整合将Harness细化为紧凑的、任务自适应的状态基础。这些结果表明,长视野代理受益于可训练的策略,用于构建和协调外部Harness工作空间,而不仅仅是添加更强大的工具或更大的内存。