论文

EMHO:用经验轨迹优化具身 Agent Harness

EMHO: EMbodied Agent Harness Optimization via Experience Traces

智能体系统智能体自我改进

摘要

改进体现的智能体通常侧重于通过训练优化底层模型,而控制规划、上下文和工具使用的周围智能体 Harness 通常是经过设计的。我们询问这个Harness是否可以在稀疏的环境反馈下直接从经验痕迹中改进自身。我们提出了 EMbodied 智能体 Harness Optimization (EMHO),这是一种自我进化框架,可以保持体现模型的冻结,并通过分析执行轨迹和先前的 Harness 历史来迭代修改其 Harness。 EMHO 优化了技能或恢复提示之外的内容,修改了智能体监控进度、使用视觉工具、地面观察和故障响应的方式。为了使用单个 Harness 支持多个子任务,我们引入了 EMHO-Merge,它通过使用情节级别的增益和损失来指导有证据支持的何时以及如何应用修订行为的细化,从而解决跨子任务联合优化单个共享 Harness 的权衡。我们在 EmbodiedBench 上跨导航和操作任务评估 EMHO,EMHO 持续改进了 Qwen 9B 和 27B 模型的 任务成功率。定性分析表明,EMHO 不仅可以从失败和无效行为中恢复,还可以重塑智能体对其环境的解释和交互方式。

EMHO:用经验轨迹优化具身 Agent Harness:论文原图
图 1:EMHO 和 EMHO-Merge 概述。在 Harness 优化期间,EMHO 使用跟踪引导修订,而 EMHO-Merge 则增加了增益-损耗细化。