论文

分层自我改进:任务特定可进化Agent Harness框架

Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses

智能体系统Agent Harness智能体自我改进递归自我改进(RSI)

摘要

现代大语言模型智能体常通过手动修改提示词、工具或工作流来改进,而围绕模型的可执行脚手架——harness——在部署后通常被视为固定产物。本研究考察另一种路径:harness是任务特定且持续可进化的,每个任务族维护自己的harness,通过固定的任务注入接缝在迭代间热替换,并利用环境反馈重写。我们提出分层自我改进(HSI),框架中单个冻结大语言模型M在三个层级范围内运作:执行任务的任务harness H、重写H的进化器,以及在冻结外层锚点下重写进化器策略代码的元进化器。开/关思考设计通过在任务执行时禁用推理而在自我修改时启用推理,分离出harness进化的贡献。HSI受两个因素约束:反馈保真度边界,因为进化需要信息丰富的奖励信号引导选择;骨干能力边界,因为harness重设计无法克服冻结模型的局限。在以DeepSeek-V4-Flash-Preview为冻结骨干的BALROG上,HSI在中等难度任务上相对初始harness取得一致提升(BabyAI +39.3、Crafter +33.0、TextWorld +25.0、MiniHack +15.0,均为原始%进度),并在BabaIsAI子套件上获得强held-out泛化(20%未见划分下BreakStop最佳测试0.98、GoTo 1.00)。在超出骨干能力的任务(NLE)上,harness进化没有带来改进。这些结果证明任务特定的harness进化是在明确经验界限内改进冻结大语言模型智能体的可行轴。代码见https://github.com/TailinZhou/hsi。

分层自我改进:任务特定可进化Agent Harness框架:论文配图
图2:Crafter上的HSI演化轨迹(设置A,meta开启)。开发奖励从初始框架(init-harness)基线0.166攀升至第4次迭代的迭代最佳值0.578(以绿星标注为导出的最佳版本),第5次迭代出现一次回归。每次迭代的注释卡在任务框架(task-harness)与演化器(evolver)两个范围上报告四个字段(种子来源、主演化编辑、结果、提交池),外加一个以绿色底色标注的meta字段,总结该迭代中元演化器对演化器策略Σ的重写内容。演化器发现的主要杠杆是将隐藏的游戏反馈显式化:奖励信号、库存状态和合成可行性依次在框架上下文中暴露;元演化器的贡献在于将这些模式固化到Σ中,使后续迭代得以继承。