论文
WHALE:关节Harness重量优化的简单方法
WHALE: A Simple Recipe for Joint Harness-Weight Optimization
摘要
代理性能共同取决于模型参数和管理上下文和控制流的可执行工具代码。单独优化任一组件可能会使系统受到其冻结对应部分的瓶颈:权重更新可以改变哪个Harness是有效的,而Harness更新可以改变公开的模型功能。现有的联合适应方法优化了权重和文本提示,但固定了更广泛的Harness。我们提出了权重Harness交替学习(WHALE),这是一个交替两个阶段的简单方法:更新当前Harness下的模型,然后在更新的模型下搜索更好的Harness。我们分别使用在线拒绝采样 微调 和 Meta-Harness 来实例化这两个阶段。何时切换是一个关键的设计选择:为了将真正的改进与噪声分开,而又不会针对不断变化的对手进行过度优化,WHALE 使用固定的阶段持续时间或针对训练信号的自适应耐心规则。在三个领域(搜索问答、数学推理和国际象棋谜题)中使用 Qwen3.5-2B/4B 代理,WHALE 在最佳mean@8 准确率方面比仅重量训练、仅吊带训练和快慢训练高出 4.15-24.38 个百分点。任一组件都可能成为瓶颈:利用 SearchQA 来匹配仅权重峰值精度,而 SearchQA 中的部署要少得多,但只有在权重更新后才能提高数学精度。小的交错更新在准确性和部署成本方面也优于分阶段权重然后利用优化。代码可在 https://github.com/krafton-ai/WHALE 获取。