论文

AI智能体不会单独失败:上下文先失败

AI Agents Do Not Fail Alone:The Context Fails First

模型评测上下文与知识上下文工程评测方法与指标

摘要

上下文工程已成为构建可靠AI智能体的核心,但它在很大程度上未被度量。智能体不是孤立失败的:其行为由累积在上下文中的指令、工具、记忆、检索知识、护栏与不可信输入塑造。当上下文薄弱时,智能体漂移、幻觉、误用工具、无视约束、易受注入攻击并浪费token。本文验证上下文工程质量作为智能体可靠性的独立领先指标。我们在ProofAgent-Harness中实现该度量——一个使用多评审员共识评分的AI智能体评估开源基础设施。治控跨七个标准评估上下文:角色清晰度、护栏覆盖、指令一致性、工具模式质量、落地充分性、注入加固与token效率。关键在于,上下文分与行为度量及发布决策隔离——使能非循环验证。通过跨受监管智能体域的受控上下文质量研究——固定前沿LLM智能体、只变化其运行上下文——我们显示上下文质量标准持续预测其对应的行为结果:落地充分性预测抗幻觉、护栏覆盖预测抗操纵、指令一致性预测指令遵循、工具模式质量预测工具使用。结果确立上下文度量作为智能体可靠性的经验证的起飞前信号,并把上下文工程定位为智能体评估与治理的可审计层。

AI智能体不会单独失败:上下文先失败:论文配图
图 1:AI 代理上下文工程技术的分类。该图对用于塑造智能体推理信息环境的主要方法进行了分组,包括指令脚手架、基础、工具上下文、内存、压缩、安全强化和护栏以及多智能体编排。