论文

MESH-Harness:通过多臂老虎机引导的组合演化改进智能体Harness

MESH-Harness: Self-Improving Agent Harnesses via Bandit-Guided Compositional Evolution

智能体系统上下文与知识上下文工程Agent Harness智能体自我改进

摘要

智能体Harness是组织语言模型上下文、维护状态并协调工具调用的代码。我们研究在保持模型权重固定的情况下,如何用有限的评估预算改进Harness。MESH-Harness把每个Harness组织成具有明确角色接口的功能模块,使各模块的替代实现可以相互替换和重新组合。它使用共享模块表示及全协方差LinUCB,根据预测性能和探索价值为候选组合评分。混合起点的坐标上升在不枚举整个组合空间的情况下,选出完整配置进行评估。随后,验证轨迹指导局部代码修改,所得候选被纳入容量固定、按角色区分的候选池,以供后续重新组合。在候选评估预算匹配的条件下,MESH-Harness在文本任务、检索增强数学推理、代码生成和交互式科学任务上,分别比Meta-Harness高5.70、7.01、2.00和5.00分。迭代Harness优化相较首轮配置提升5.63—7.79分。对于报告的配置,测试阶段总成本比Meta-Harness低44.2%,包含搜索的总成本低14.6%。这些结果表明,将模块设计复用与反馈驱动的组合搜索结合,可以系统性地改进智能体Harness,同时控制整体优化成本。

MESH-Harness:通过多臂老虎机引导的组合演化改进智能体Harness的原论文方法或结果图
图3:相对于各方法各自参考配置的最终性能。“Initial”分别指Meta-Harness的固定参考种子和MESH-Harness首个被评估的组合,并非共同初始化。Meta-Harness参考分数为50.00(Text)、42.38(Math,ACE)、71.00(LiveCodeBench)及55.50(ScienceWorld)。括号表示最终分数减去参考分数。