论文
从模型扩展到系统扩展:扩展Agentic AI中的Harness
From Model Scaling to System Scaling: Scaling the Harness in Agentic AI
摘要
本文研究agentic AI的下一个主要瓶颈——系统扩展而不仅是模型扩展:围绕基础模型设计可审计、持久、模块化且可验证的架构。我们将这一转变称为扩展Harness:把围绕基础模型的结构化执行层当作设计、评估与优化的一等对象。尽管近期大语言模型使智能体能够使用工具、检索信息、维护记忆并执行长时程工作流,评估在很大程度上仍以模型为中心,常常把智能体简化为最终任务成败,而将记忆、检索、工具使用、编排、验证与治理视为次要的实现细节。这一框架日益不充分,因为智能体性能源于基础模型、记忆基底、上下文构造器、技能路由层、编排循环与验证治理层之间的交互。这些组件共同构成智能体Harness,将模型能力转化为长时程智能体行为。我们通过三个核心瓶颈研究Harness扩展:上下文治理、可信记忆与动态技能路由,以及协调并约束它们的编排与治理机制。我们进一步概述了Harness级基准的研究议程:超越一次性任务成功,度量轨迹质量、记忆卫生、上下文效率、通信保真度、验证成本与随时间的安全演化。为使讨论具体化,我们开发了CheetahClaws(https://github.com/SafeRL-Lab/cheetahclaws),一个Python原生参考Harness,并与Claude Code和OpenClaw进行比较。我们的核心主张是:agentic AI的未来进展将同样取决于系统设计与更强的基础模型。
