论文

资源感知LLM智能体的Stackelberg框架:学习、修复与条件性保证

A Stackelberg Framework for Resource-Aware LLM Agents: Learning, Repair, and Conditional Guarantees

智能体系统Agent HarnessAgent Runtime

摘要

大语言模型(LLM)智能体日益作为多轮系统运作——必须在有限计算预算下分配上下文、提示冗长度与工具访问。静态阈值简单——但在异构任务与演化会话状态下脆弱。我们把资源治理形式化为情境Stackelberg博弈:控制器承诺质量目标与成本激励——执行器以跨上下文、提示与工具使用的资源动作响应。我们学习条件响应模型——对照该模型优化领导者策略——并用真实API校准与到经验选择动作集的投影修复所得策略。对受限博弈——我们建立均衡存在性、跟随者响应稳定性、安全集投影以及代理环境到真实环境迁移(在有界值误差下)的条件性保证。主要真实API实验含300个受评轮次。相对保守基线——选定的修复后控制器降低平均token成本17.4%(Welch p=0.022)——而测得的质量差异统计不显著(p=0.44)。理论结果为条件性且实验未估计其遗憾或迁移常数;因此证据确立的是一个有前景的修复运行点——而非经认证的真实系统均衡。