论文
给评分者打分:评估智能体数据分析系统的经验教训
Grading the Grader: Lessons from Evaluating an Agentic Data Analysis System
摘要
智能体数据分析系统产出丰富的输出——包括代码、数值结果与口头诊断。这使其比单轮LLM响应更难评估。因此有必要把智能体输出与真值答案间的真实分歧与评分工件区分开。我们通过把多智能体数据分析系统LAMBDA应用于DSGym的153个数值QRData任务——考察自动评分器评估此类系统的可靠程度——以及哪些策略能改进评分质量。我们开发并评估三层人机评分级联:严格正则匹配、基于LLM的宽松评分与基于片段的人工检查——组合具有不同失败特征的非生成式与生成式策略。两个自动评分器都达到100%观测精确率(70例0假阳性)。宽松评分器对照人工标签召回97%。关键词锚定抽取管线使严格评分器的召回较末位数字启发式提高60个百分点;宽松评分器在架构上与解析器无关。迭代催促机制把评分运行成功率从36%提升到97%、宽松通过率从16%提升到46%;对比有/无原题重注入的催化表明重注入无益——确认催促本质是答案模板提示。我们还观察到变量类型是与评分管线动态及观测结果等级最一致关联的任务元数据字段。
