论文
分布偏移下可靠长程智能体上下文演化的范围验证
Scoped Verification for Reliable Long-Horizon Agentic Context Evolution under Distribution Shift
摘要
部署的LLM智能体依赖智能体上下文——由运行治控组装的模型外文本控制内容。本工作中,该上下文的可变成分是一个持久的系统级指令:从运营经验更新,而模型、工具与治控保持固定。在长演化时程上,扁平文本维护使验证愈发困难——累积的指令增长并相互作用。我们提出图正则化智能体上下文演化(GRACE):把持久指令组件维护为类型化语义图,在修改节点的局部类型化邻域内验证提议更新;被接受的图更新重构为部署所用文本指令检查点的增量编辑。我们在τ²-bench衍生的固定电信智能体治控内、受控分布偏移协议下评估GRACE。跨五次独立重复:GRACE把以pass³度量的严格可靠性从Gemini 2.5 Flash零样本的0.091提升到最终检查点的0.673±0.136——超过同留出集上Gemini 3.1 Pro零样本参考0.242,而扁平文本HCE基线止步于0.191±0.051。结果识别出可靠长程上下文演化的两个要求:使验证局部化的结构基底,与保持累积指令内容可用的整合机制。
