论文
有状态 CARS:策略受限 LLM 代理的精确跨历史重用
Stateful CARS: Exact Cross-History Reuse for Policy-Constrained LLM Agents
摘要
使用工具的语言模型代理面临着约束,其含义随着观察和先前的行动而变化。我们研究以硬状态验证器为条件的模型分布的精确采样,同时跨历史重用无效证书。有状态的 CARS 会冻结每次尝试中的一系列健全状态-延续模式,并删除包含匹配抽象状态的经过认证的延续的每个轨迹。从生成的提案中提取精确的残差 Doob 变换样本。我们给出了可检查的未来有效性互模拟条件,证明模式健全性、自适应精确性、独立同分布\输出、几乎肯定的终止、单调接受和压缩不变性,并通过可到达的全历史产品状态的数量来表征计算。对于依赖于历史的语言模型来说,这个数字可能是指数级的;因此,评估的方法没有提出通用的有限特里结构可扩展性声明。在可枚举工作流上,其分析定律以 $6\times10^{-8}$ 的有效性概率将有效条件匹配到 $10^{-16}$,而状态感知本地解码可能需要 $0.97$。匹配的比较是否定的:观察键控的官方 CARS 在采样器步骤中更便宜(根/状态比率 $0.942$ $[0.934,0.951]$),并且 Qwen 比较为空($0.99$ $[0.90,1.08]$)。跨历史转移仅有助于内部匹配密钥消融($1.27\times$)。因此,证据支持精确的图式诱导调节,而不是相对于 CARS 的系统优势。