技术实践

阿里云验证AgentLoop的经验注入效果

智能体系统上下文与知识模型评测上下文工程Agent任务评测评测方法与指标模型能力评测

概述

阿里云团队把 Agent 真实运行的 Trace 清洗去噪并组装为标准化 Trajectory(内部复杂样本中高价值轨迹可降至原始 Trace 约 4%—6% 数据量级),跨多条轨迹自动挖掘工具选择顺序、参数规则、失败反模式与恢复策略等结构化经验,再经 Recall Skill 与 CLI 在任务开始、调用工具、出错与交付前召回并注入运行时上下文。 在运维、通用工具使用、专业 Agent 和软件工程等任务上完成了经验注入实验:StarOps 指标查询正确率由 7.1% 提升至 36.1%(Token -6.8%,平均工具调用次数下降 25.1%、有害事件下降 27.8%)。OpenClaw/PawBench 通过率 24.53%→30.67%(Token -58.16%)。 ClawProBench 74.51%→78.43%(Token -11%)。PinchBench 提升 18.3%(Token +2.9%)。SWE-bench Verified 67.2%→74.4%(Token 362.4M→536M),实验同时暴露质量与成本存在权衡。