论文
AI智能体不会单独失败:上下文先失败
AI Agents Do Not Fail Alone:The Context Fails First
摘要
上下文工程已成为构建可靠AI智能体的核心,但它在很大程度上未被度量。智能体不是孤立失败的:其行为由累积在上下文中的指令、工具、记忆、检索知识、护栏与不可信输入塑造。当上下文薄弱时,智能体漂移、幻觉、误用工具、无视约束、易受注入攻击并浪费token。本文验证上下文工程质量作为智能体可靠性的独立领先指标。我们在ProofAgent-Harness中实现该度量——一个使用多评审员共识评分的AI智能体评估开源基础设施。治控跨七个标准评估上下文:角色清晰度、护栏覆盖、指令一致性、工具模式质量、落地充分性、注入加固与token效率。关键在于,上下文分与行为度量及发布决策隔离——使能非循环验证。通过跨受监管智能体域的受控上下文质量研究——固定前沿LLM智能体、只变化其运行上下文——我们显示上下文质量标准持续预测其对应的行为结果:落地充分性预测抗幻觉、护栏覆盖预测抗操纵、指令一致性预测指令遵循、工具模式质量预测工具使用。结果确立上下文度量作为智能体可靠性的经验证的起飞前信号,并把上下文工程定位为智能体评估与治理的可审计层。
