技术实践

阿里用上下文压缩和分层记忆重建Agent运行时

上下文与知识智能体系统AI 基础设施上下文工程记忆Agent 架构与控制循环Agent Harness可观测性Agent记忆Agent Runtime

概述

阿里团队在 128K 上下文窗口约束下把 S1 的「工作流编排 + 单轮对话」重建为 S2 的完整运行时:按数据膨胀时间顺序建四层上下文防线——L1 大结果外置引用(字符数 >8000、数组元素 >10、alwaysStore,存 MySQL 只留 refId 与有界摘要)、L2 LLM 语义压缩(单条 >10000 字符触发,输出上限 2000 字符,temperature=0.3,经线上 2000+ 次压缩验证稳定)、L3 对话压缩(prompt_tokens/contextWindow ≥85% 触发,目标压缩到 30%,产出含用户原始请求、分阶段执行历史、已放弃路径与数据引用索引的结构化交接文档)、L4 DataBus 按需预取(小数据 ≤4096 字符直取、大数据生成上限 1000 字符增强摘要,并提供 outline/search/context 检查模式);配合 State/Working Memory/Transcript 三层记忆与单一表示原则、Prompt 预算预检。执行引擎升级为 PERO 编排与执行推送分离,事件流为唯一真相源并支持断点续传:15 步选品任务第 12 步超时失败,由过去重跑全部 15 步约 6 分钟变为从第 12 步恢复约 30 秒;以 parameterBindings 声明式绑定取代五层修复管道,配 RecursionGuard(深度 5、链路 20、环检测)等护栏。组合效果为 Token 消耗降低 60%+,复杂任务推理质量从 S1「8 步开始衰减、15 步几乎不可用」变为 S2「30+ 步稳定执行」。 后续材料(2026-07-20):Prompt 工程阶段的顶峰产品 S1(FY26 上半年第一代 Agent 系统)以「工作流编排 + 单轮对话」架构,用三个月跑通了「AI 能做大促」的最小可行产品,8 月覆盖全量活动场景,活动举办效率提升 50%,验证了大促场景由 AI 承接的方向可行。上线后暴露三个结构性缺陷:无容错(纯内存 while 循环,15 步任务第 12 步失败只能从头重跑约 6 分钟,用户关闭页面即丢失结果)、上下文膨胀逼近 128K 窗口上限并引发注意力稀释、单向管道不回头检查导致长链路误差放大;这三个缺陷被判定为架构选择的必然后果而非可修 bug,直接推动 S2 以完全不同的架构假设从零重建(详见同文另一条事实)。