论文

Harness演化遇到上限后:按失败结构决定是否训练权重

Harness Evolution Hits a Ceiling: When Weight Training Should Begin

智能体系统模型训练参数高效训练智能体自我改进

摘要

改进长期LLM Agent可以演化冻结模型周围的Harness,也可以训练模型权重。我们先让自演化Harness增强系统,再交叉比较初始与演化Harness、基础与训练权重,研究训练模型保留了哪些增益、哪些仍依赖运行时。选择合适改进手段可以依据Agent的失败构成:按失败轨迹中第一个触发信号分类,可区分流程失败,如被阻断调用、循环和步数预算耗尽,与内容失败,即已经交付但质量差的计划。Harness演化修复前者,它形成的行为可训练进权重,内容失败则需要权重训练。在DeepPlanning中,自演化Harness将Qwen3.5-4B的留出分数从0.16提升到0.30,将9B模型从0.32提升到0.44;4B模型的留出交付率从55%提高到90%,内容失败留给权重解决。在演化Harness轨迹上训练的LoRA适配器吸收了增益:使用原始Harness时,两种模型的留出任务得分均增加0.13。4B适配器与Harness叠加后,使留出分数超过原来的两倍;9B模型仅靠适配器便追平完整演化方案,将内容失败从约四分之一轨迹降到约二十分之一。用打乱答案的轨迹训练的安慰剂适配器低于基础模型。该循环迁移到WebArena-Lite的117个未见任务后提高0.09,而此处收益来自模型看到的信息,适配器没有额外增益。结果支持两次应用“先诊断再干预”:先读失败构成以选择Harness或权重,再读已接受修改的内容以决定哪些增益应训练进模型。分数为相对于新锚定参照的四次Rollout均值;除特别标注外,评测在同一晚进行,覆盖来自六个家族的八种模型和两种基准。