论文

MemoHarness:从经验中学习的智能体治控

MemoHarness: Agent Harnesses That Learn from Experience

智能体系统上下文与知识记忆Agent HarnessAgent记忆

摘要

智能体治控是把基座LLM变成可执行智能体的外部控制层:管理上下文、工具、编排、记忆、解码与输出处理。虽然治控设计强烈影响智能体行为,多数自动改进方法优化更窄的工件——提示、管线或工作流——而部署的智能体通常对所有情况复用单一全局治控。我们提出MemoHarness:一个从自身执行中学习的自适应治控优化框架。MemoHarness把治控分解为六个可编辑控制维度,在双层经验库中存储逐案例诊断与蒸馏的全局模式,并使用检索到的经验把学到的治控适配到每个测试用例——无需测试时标签、反馈或额外搜索。在跨shell智能体、代码生成与分析推理基准的评估中:MemoHarness超过我们对比的固定治控,并展现向未见套件与基座模型的选择性迁移。其附加上下文在大部分检索经验可缓存时也能保持成本竞争力。结果提供证据:执行经验是构建比单一静态配置更具适应性的智能体治控的实用基底——同时把关于统计鲁棒性与组件归因的更广主张留给后续工作。

MemoHarness:从经验中学习的智能体治控:论文配图
图 1:MemoHarness 概述。 A 阶段(搜索,训练时优化)在六维线束空间 𝒲=∏d=16𝒲(d)\mathcal{W}=\prod_{d=1}^{6}\mathcal{W}^{(d)} 上运行引导搜索:每个候选线束 WW 在标记的搜索案例上执行,通过使用令牌的正确性优先奖励 ri​(W)r_{i}(W) 进行评分ci​(W)=nitokc_{i}(W)=n_{i}^{\mathrm{tok}} 作为决胜局,所得轨迹存储在双层经验库 ℬt=(Et,Gt)\mathcal{B}_{t}=(E_{t},G_{t}) 中,其中包含每个案例条目和提炼的全局模式;然后搜索策略 π\pi 提出以 ℬt\mathcal{B}_{t} 为条件的下一个 WW。 B 阶段(测试时案例适应)采用未标记的测试案例 xjtestx_{j}^{\text{test}},从 ℬt\mathcal{B}_{t} 检索相似案例和相关模式,并将全局线束 W*W^{*} 映射到特定于案例的线束 W⁡(xj)W(x_{j}),然后执行该线束以生成最终预测y^j\hat{y}_{j}。