论文

上下文组装作为受控变量:冻结LLM智能体Harness策略的控制论视角

Context Assembly as the Controlled Variable: A Control-Theoretic View of Harness Policies for Frozen LLM Agents

上下文与知识智能体系统上下文工程Agent Harness

摘要

2026年已有大量工作将控制论应用于LLM智能体:针对工具介导控制器的Lyapunov认证稳定性(Prinos等人,“Stable Agentic Control”,2026)、大规模离散工具集合上稀疏策略的样本复杂度界(Majumdar,“Sparse Agentic Control”,2026),以及将多智能体系统分解为可审计反馈回路的调节控制分解(Nogueira和Skogestad,2026)。我们并不声称将控制论引入LLM智能体——这一步早已完成。我们更窄的主张关乎受控变量究竟是什么。先前工作控制的是工具选择、智能体间消息路由或智能体的原始动作流。我们则将上下文组装本身——使用哪个提示模板、哪些少样本示例、多少检索上下文、多少轮规划/验证——视为受控变量,由位于冻结模型之外的上下文老虎机(contextual bandit)或REINFORCE策略在线学习。本文构建了形式化分解(内层冻结策略 $π_θ$,外层上下文策略 $π_φ$),给出Zhang等人(2026)所用意义下在线控制器的稳定性论证(在有界策略变化下期望奖励不降),并报告了控制器自身置信度与实际任务结果之间的不确定性校准分析。与本文对应的应用工作将同一控制器实例化于三个领域和两个模型提供商,并发布数据集、轨迹日志与部署方案;本文聚焦于形式化框架以及控制论主张所需的稳定性/不确定性证据。

上下文组装作为受控变量:冻结LLM智能体Harness策略的控制论视角:论文配图
图 1:强盗控制器和 REINFORCE 控制器的窗口平均奖励与事件(每个 2 个种子;阴影带 = 种子之间的最小/最大)。