分层自我改进:任务特定可进化Agent Harness框架
Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses
摘要
现代大语言模型智能体常通过手动修改提示词、工具或工作流来改进,而围绕模型的可执行脚手架——harness——在部署后通常被视为固定产物。本研究考察另一种路径:harness是任务特定且持续可进化的,每个任务族维护自己的harness,通过固定的任务注入接缝在迭代间热替换,并利用环境反馈重写。我们提出分层自我改进(HSI),框架中单个冻结大语言模型M在三个层级范围内运作:执行任务的任务harness H、重写H的进化器,以及在冻结外层锚点下重写进化器策略代码的元进化器。开/关思考设计通过在任务执行时禁用推理而在自我修改时启用推理,分离出harness进化的贡献。HSI受两个因素约束:反馈保真度边界,因为进化需要信息丰富的奖励信号引导选择;骨干能力边界,因为harness重设计无法克服冻结模型的局限。在以DeepSeek-V4-Flash-Preview为冻结骨干的BALROG上,HSI在中等难度任务上相对初始harness取得一致提升(BabyAI +39.3、Crafter +33.0、TextWorld +25.0、MiniHack +15.0,均为原始%进度),并在BabaIsAI子套件上获得强held-out泛化(20%未见划分下BreakStop最佳测试0.98、GoTo 1.00)。在超出骨干能力的任务(NLE)上,harness进化没有带来改进。这些结果证明任务特定的harness进化是在明确经验界限内改进冻结大语言模型智能体的可行轴。代码见https://github.com/TailinZhou/hsi。
