技术实践

Snowflake将 TruLens 轨迹感知评估集成进 MLflow

智能体系统Agent任务评测

概述

这是 Snowflake 机器学习团队与 MLflow 社区合作的一次工程集成。聊天机器人走向自主智能体后,只对最终答案判通过与否已经不够:答案正确却靠幻觉式工具调用或冗余步骤达成的执行轨迹,在生产环境往往难以存续。为此双方把 TruLens 的轨迹感知评估直接集成进 MLflow,核心是将 Agent GPA(Goal-Plan-Action)评分器接入 mlflow.genai.evaluate(),不给单一的通过与否结论,而是沿目标—计划—行动的推理回路逐项打分,覆盖目标与计划对齐、计划质量、工具选择与调用、计划遵从、逻辑一致性、执行效率、答案相关性及证据支撑度等维度。集成包含一层轨迹适配,把 MLflow span 映射为 TruLens 评分器所需结构,并附带兼容性测试保持既有评估工作流稳定,实现细节在上游 PR 公开。官方博客援引论文基准称,在 TRAIL/GAIA 测试集上,GPA 评委识别出 95%(267/281)的人工标注错误,基线 TRAIL 评委为 55%(154/281);错误定位准确率 86% 对 49%。该对比属基准测试而非生产实测,数字为发布方自述。