论文

分布偏移下可靠长程智能体上下文演化的范围验证

Scoped Verification for Reliable Long-Horizon Agentic Context Evolution under Distribution Shift

上下文与知识上下文工程

摘要

部署的LLM智能体依赖智能体上下文——由运行治控组装的模型外文本控制内容。本工作中,该上下文的可变成分是一个持久的系统级指令:从运营经验更新,而模型、工具与治控保持固定。在长演化时程上,扁平文本维护使验证愈发困难——累积的指令增长并相互作用。我们提出图正则化智能体上下文演化(GRACE):把持久指令组件维护为类型化语义图,在修改节点的局部类型化邻域内验证提议更新;被接受的图更新重构为部署所用文本指令检查点的增量编辑。我们在τ²-bench衍生的固定电信智能体治控内、受控分布偏移协议下评估GRACE。跨五次独立重复:GRACE把以pass³度量的严格可靠性从Gemini 2.5 Flash零样本的0.091提升到最终检查点的0.673±0.136——超过同留出集上Gemini 3.1 Pro零样本参考0.242,而扁平文本HCE基线止步于0.191±0.051。结果识别出可靠长程上下文演化的两个要求:使验证局部化的结构基底,与保持累积指令内容可用的整合机制。

分布偏移下可靠长程智能体上下文演化的范围验证:论文配图
图 1:GRACE 演进流程概述。给定诊断报告和当前图 Gt−1G_{t-1},管道通过三个阶段生成更新的图 GtG_{t} 和相应的指令检查点 ℓt\ell_{t}:操作规划、结构验证和增量重建。序列规划作为操作规划中的子步骤执行,而结构验证将确定性模式检查与迭代结构分析 (SA) 结合起来。