论文
LAM智能体Harness资源理论
Harnessing LLMs as Agents: What Does It Cost?
摘要
语言模型智能体日益依赖管理有界上下文、持久记忆、工具、验证与重复执行的Harness,但现有的模型能力概念并未量化这些机制消耗的计算资源。我们提出语言模型智能体机器(LAM),一个资源有界抽象:固定底层语义模型的同时显式为Harness层资源计费。我们建立四类结果。通信:LAM执行在同时的调用-转移预算下逐实例等价于红蓝.pebbling,把经典I/O下界迁移到上下文-内存流量。访问:内存接口诱导渐近分离,包括指针追踪上随机访问与非投机顺序访问之间的Θ(n)差距。重算:位反转DAG在上下文容量C与持久记忆容量S下需要Θ(n²/(C+S)+n)次模型调用,量化了何时存储中间状态可避免重复语义计算。可靠性:我们推导紧的阶段局部采样界、精确的不完美验证成本,以及具有闭式最优验证区间的Young-Daly型检查点律。在GPT-6 Astra上的受控与保留实验检验了通信与可靠性预测,包括检查点最优、程序化检查下的策略选择,以及链式MATH任务上调用粒度、逻辑输入流量与可靠性之间的权衡。这些结果为语言模型智能体Harness的计算成本提供了资源理论。