技术实践
淘天以Trace、扰动和因果测试定位Agent质量问题
概述
淘天团队把 Agent 拆解为独立模块分别评估:工具选择准确率(不仅要求在可用列表内、还要求是最优选择)、参数构造质量、规划合理性、推理链质量、资源效率,形成根因诊断矩阵。按数据可获得性分三条路径:一、有完整 Trace 时做高精度组件级归因,分三阶段打点(先监控工具调用序列与最终结果建基线,再加参数质量与规划合理性评估,最后用 SHAP 量化各组件权重),并把历史 Trace 汇总成特征表识别与失败强相关的组件。 二、无中间数据时做扰动式黑盒归因,对 Prompt 要素(指令、示例)与工具配置设计 3–5 个变体,基线运行 N≥10 次、每个变体 M≥20 次,贡献度 =(基线均分 − 扰动后均分)/ 基线均分 × 100%。三、用因果 A/B 测试控制混杂变量,绘 DAG 识别混杂(Query 复杂度、用户经验、时间段),采用完全随机化/分层随机化/配对设计,并按数据特点选 t-test、PSM、双重稳健估计或神经正交学习,最后做敏感性分析。 文中三类案例(工具描述模糊选错工具、参数格式错误、规划步数过多超时)均标注为示例性数据。