论文
MESH-Harness:通过多臂老虎机引导的组合演化改进智能体Harness
MESH-Harness: Self-Improving Agent Harnesses via Bandit-Guided Compositional Evolution
摘要
智能体Harness是组织语言模型上下文、维护状态并协调工具调用的代码。我们研究在保持模型权重固定的情况下,如何用有限的评估预算改进Harness。MESH-Harness把每个Harness组织成具有明确角色接口的功能模块,使各模块的替代实现可以相互替换和重新组合。它使用共享模块表示及全协方差LinUCB,根据预测性能和探索价值为候选组合评分。混合起点的坐标上升在不枚举整个组合空间的情况下,选出完整配置进行评估。随后,验证轨迹指导局部代码修改,所得候选被纳入容量固定、按角色区分的候选池,以供后续重新组合。在候选评估预算匹配的条件下,MESH-Harness在文本任务、检索增强数学推理、代码生成和交互式科学任务上,分别比Meta-Harness高5.70、7.01、2.00和5.00分。迭代Harness优化相较首轮配置提升5.63—7.79分。对于报告的配置,测试阶段总成本比Meta-Harness低44.2%,包含搜索的总成本低14.6%。这些结果表明,将模块设计复用与反馈驱动的组合搜索结合,可以系统性地改进智能体Harness,同时控制整体优化成本。
