论文

从模型扩展到系统扩展:扩展Agentic AI中的Harness

From Model Scaling to System Scaling: Scaling the Harness in Agentic AI

智能体系统上下文与知识记忆Agent HarnessAgent记忆

摘要

本文研究agentic AI的下一个主要瓶颈——系统扩展而不仅是模型扩展:围绕基础模型设计可审计、持久、模块化且可验证的架构。我们将这一转变称为扩展Harness:把围绕基础模型的结构化执行层当作设计、评估与优化的一等对象。尽管近期大语言模型使智能体能够使用工具、检索信息、维护记忆并执行长时程工作流,评估在很大程度上仍以模型为中心,常常把智能体简化为最终任务成败,而将记忆、检索、工具使用、编排、验证与治理视为次要的实现细节。这一框架日益不充分,因为智能体性能源于基础模型、记忆基底、上下文构造器、技能路由层、编排循环与验证治理层之间的交互。这些组件共同构成智能体Harness,将模型能力转化为长时程智能体行为。我们通过三个核心瓶颈研究Harness扩展:上下文治理、可信记忆与动态技能路由,以及协调并约束它们的编排与治理机制。我们进一步概述了Harness级基准的研究议程:超越一次性任务成功,度量轨迹质量、记忆卫生、上下文效率、通信保真度、验证成本与随时间的安全演化。为使讨论具体化,我们开发了CheetahClaws(https://github.com/SafeRL-Lab/cheetahclaws),一个Python原生参考Harness,并与Claude Code和OpenClaw进行比较。我们的核心主张是:agentic AI的未来进展将同样取决于系统设计与更强的基础模型。

从模型扩展到系统扩展:扩展Agentic AI中的Harness:论文配图
图 1:代理系统的六部分视图: 𝒫H=Φ⁡(ℛ,ℳ,𝒞,𝒮,𝒪,𝒢)\mathcal{P}_{H}=\Phi(\mathcal{R},\mathcal{M},\mathcal{C},\mathcal{S},\mathcal{O},\mathcal{G})。编排层 (𝒪\mathcal{O}) 包装了一个控制循环,其中上下文构造函数 (𝒞\mathcal{C}) 从持久内存 (ℳ\mathcal{M}) 和当前任务中提取数据,以组装推理基质的输入(ℛ\mathcal{R},即基础模型)。技能路由器 (𝒮\mathcal{S}) 调度工具或子代理;它们对环境的影响以及模型的中间步骤在成为允许的操作或经过验证的内存写回之前通过验证和治理(𝒢\mathcal{G})进行控制。模型缩放改进了 ℛ\mathcal{R};系统缩放改进了 ℳ,𝒞,𝒮,𝒪\mathcal{M},\mathcal{C},\mathcal{S},\mathcal{O} 和 𝒢\mathcal{G}。