论文

Co-Harness:LLM智能体运行框架与模型权重的协同演化

Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents

智能体系统Agent HarnessAgent Skills智能体自我改进

摘要

为自动化AI研究开展智能体后训练,不仅需要优化模型参数,还需要优化运行时框架(harness)——它决定了研究轨迹如何被生成、评估与学习。现有流水线通常在固定框架(包括提示、工具、技能、中间件与记忆)下训练模型,而将数据生成过程置于优化目标之外。这造成了模型更新与决定轨迹质量的静态脚手架之间的错配。我们提出Co-Harness,一个在后训练期间联合优化智能体框架与模型参数的框架。Co-Harness在框架优化与模型优化之间交替进行。基于LLM的HarnessCritic分析失败轨迹,识别框架层面的失效模式,并提出经验证的局部更新。随后模型在改进后框架生成的高质量轨迹上微调,将有效脚手架蒸馏进模型参数。一项超过200小时的自主案例研究进一步表明,Co-Harness能在无人工干预下从系统崩溃中恢复、提升推理效率并发现集成策略。这些结果表明,框架与模型联合优化是超越固定框架后训练、改进智能体的有效途径。

Co-Harness:LLM智能体运行框架与模型权重的协同演化:论文配图
图 1:联合线束双环概述。