论文

实时数据科学任务的技能型智能体评估

Skill-based Agentic Evaluation for Real-time Data Science Tasks

智能体系统Agent任务评测

摘要

我们提出在实时持续更新数据上评估数据科学智能体的框架,结合可执行真值与不依赖格式的事实点评分。例如询问“上周受众规模是多少”,参考答案随数据变化,静态答案过时,标准大模型评审不能对固定真值核验。核心贡献真值即代码,将预期答案写成可执行参考函数,在评估时直接从实时数据重算,确保与系统一致。我们结合事实点级格式无关评审,把智能体回答与计算真值拆成原子主张,衡量精确率、召回率和准确率,不受散文、列表、表格、HTML等格式影响。方法适用于预期输出能表示为可执行数据计算的智能体。我们以内部开发并已生产部署的机器学习技能开展人工与模型一致性研究,使用复现生产模式和实体关系的合成数据库。相对自然语言真值基线,方法使衡量专家标注与模型评审类别均衡一致性的Matthews相关系数提高29%,每测试token减少16%;缺少显式真值的自主评审基线与人工判断负相关。工业界常部署多源集成和非平稳数据计算智能体,我们据此提出真值即代码的实用评估方法。