词元预算:63 个 LLM-Agent 预算超支事件的经验目录,以仿射型 Rust 缓解作为案例研究
Token Budgets: An Empirical Catalog of 63 LLM-Agent Budget-Overrun Incidents, with an Affine-Typed Rust Mitigation as a Case Study
摘要
LLM-agent 预算超支是一个记录在案的生产故障类别:在操作员注意到之前,单个重试循环可能会花费数千美元,并且会阻止它的进程内完整性属性(无别名、无双花、无成本承担值的委托后使用)是由临时包装器而不是类型系统强制执行的。我们的核心贡献是实证性的:来自 21 个编排框架(2023-2026)的 63 个已确认的生产事件的目录,每个事件都由引用的 GitHub 问题支持,并且在报告的情况下,美元损失被组织成八集群故障分类法(评估者间 Cohen 的 kappa = 0.837,N = 113),加上 47 个补充结构条目。作为针对此分类法评估的一项缓解措施,我们构建了词元预算,这是一个 1,180 行的 Rust 箱(没有不安全),它可操作仿射所有权,以便克隆、双重支出或在委托后使用预算是编译错误,而不是操作员必须记住避免的运行时危险。美元上限是估计器假设下的运行时算术;仿射层使得该算术不可绕过。在单代理工作负载上,4 行 Python 计数器在 0/30 过冲时与包匹配,因此区别值是多代理委托中操作员错误下的不可绕过性:11 个事件中记录的委托扇出竞争在编译时被借用检查器拒绝,而 asyncio 下的相同模式超过 30/30,三个纪律替代方案超过 0/30。在五个运行时、三个提供程序和温度分层实时 API 测试 (N = 160) 中,该方法报告了零上限违规和零错误拒绝,与并发工作的操作相当。静态超额预留为 4-6 倍(2.11 倍自适应)。正在运行的二进制文件的二进制级别上限健全性保持开放状态。