技术实践

淘天以因果推断归因LLM与Agent评测结果

模型评测智能体系统应用与实践Agent任务评测评测方法与指标模型能力评测结构化分析、预测与决策

概述

针对传统 LLM 评测只看任务完成率与输出质量、面对 Agent 系统无法回答“到底是哪个环节驱动结果变化”的问题,团队把数据科学的因果分析范式引入 AI 评测:核心目标是用因果推断与博弈论方法量化“因”对“果”的贡献度,精准定位复杂 AI 系统(LLM、Runtime Env、Tools 等)的优化瓶颈。 方法侧整合 Rubin 潜在结果模型(TE/ATE/CATE、PSM、DID、IV、DML)与 Pearl 因果图(do-算子、后门/前门准则、SCM),工具侧对比选型 DoWhy(因果图建模 + 自动反驳检验)、EconML(正交机器学习、异质性处理效应)、CausalML(Meta-Learner)与 SHAP(Shapley 值,效率性/对称性/哑元性/可加性),并以冰淇淋与溺水、Query 复杂度混杂等例说明相关不等于因果(辛普森悖论)。 该评测与优化工作服务于「秒杀红包」「营销大促」「购物助手」「本体建设」等淘天核心 AI 应用场景的规模化落地与持续迭代。