技术实践

天猫TMIC以DeepAgent规划跨模块数据洞察

智能体系统模型推理上下文与知识模型评测测试时计算扩展上下文工程检索增强知识库Agent 架构与控制循环Agent 规划Agent 工具调用Agent 协作Agent HarnessAgent任务评测基准与评测资源评测方法与指标Agent Runtime

概述

AI 小新是 TMIC 平台的核心 AI 问答产品,原定制化 workflow 存在不能跨产品模块回答、回答思路过于定制、总结时上下文信息有限三大痛点。新版借鉴 DeepAgent 设计思路,引入 TodoList(任务规划与进度跟踪)、SubAgent(任务分解与上下文隔离、并行执行)、Summary(上下文自动压缩,压缩到原始数据 10%-30%)、FileSystem(大工具结果落文件,本场景评估后未采用),把预设流程交给 AI 自主决策,支持单次对话调用多个业务模块工具、动态参数识别(如类目层层下钻)与基于全局执行历史的深度分析。 针对 DeepAgent 落地后的性能瓶颈做三项优化:Tree Action 模式按依赖关系执行 Action Tree,单次 Planning 输出完整动作树并按层并行,测试集上 Planning 次数从 3.20 次优化到 2.44 次(典型场景从三次 Planning 减少到一次);简化 SubAgent 职责(去掉重复上下文加载),SubAgent 平均执行时间从 103 秒优化到 20 秒;把 Summary 从串行改为与 Planning 异步并行,单节点 Summary 耗时约 60 秒也不再阻塞主流程。 为解决『工具过多导致上下文混乱和决策困难』(平均每个业务模块 10-20 个工具),团队采用提前决策方案:在 DeepAgent 执行前由业务模块识别从单一模块升级为多模块,据此筛选并加载相关工具(三层树状结构:业务模块→功能模块→工具,另有跨模块公共工具只加载一次)、加载各模块 Skills(分析思路与业务定制逻辑,如取不到类目用主营类目、多价格带取 GMV 占比最高的)、加载分析思路 RAG 与业务模块 RAG 并过滤、前置并行获取系统参数与业务模块参数(如新品列表只预加载命中率最高的前 5 条,其余由 Planning 按需调用)。 团队构建了覆盖用例收集、批量执行、模型评测、人工复核、数据回流的自动化评估闭环:第一批共收集 150 个典型问题(来源为线上收集、测试构造、RAG 筛选,也可用大模型扩写),涵盖不同业务模块/问题类型/复杂度;评测分过程指标(业务模块定位准确率、RAG 召回率、分析思路准确性、Execute Action 执行准确率、Analysis 输出完整性)、整体指标(逻辑一致性、数据支撑、相关性、洞察深度、可行性、安全风险)与性能指标(思考 RT、生成报告 RT、总 RT);评估中发现的高质量数据经质量校验后回流到 RAG 库。