论文

JADE:面向开放式专业任务的基于专家知识的动态评估

JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks

模型评测评测方法与指标

摘要

在开放式专业任务上评估代理人工智能面临着严格性和灵活性之间的根本困境。静态评估标准提供了严格的、可重复的评估,但无法适应多样化的有效反应策略,而大语言模型作为法官的方法适应个人反应,但存在不稳定和偏见。人类专家通过将基于领域的原则与动态的声明级评估相结合来解决这一困境。受这个过程的启发,我们提出了 JADE,一个两层评估框架。第一层将专家知识编码为一组预定义的评估技能,提供稳定的评估标准。第 2 层执行特定于报告的声明级别评估,以灵活评估不同的推理策略,并通过证据依赖门控来使基于反驳声明的结论无效。 BizBench 上的实验表明,JADE 提高了评估稳定性,并揭示了基于 LLM 的整体评估器遗漏的关键代理故障模式。我们进一步展示了与专家撰写的标准的强烈一致性,以及向医疗领域基准的有效转移,从而跨专业领域验证了 JADE。我们的代码可在 https://github.com/smiling-world/JADE 上公开获取。

JADE:面向开放式专业任务的基于专家知识的动态评估
图2:JADE概览。给定一个查询和一个由agent生成的响应,JADE首先激活合适的由专家编写的技能,以指导查询特定清单的生成。然后,它为可验证的事实性声明和推理质量导出报告特定清单。事实性声明通过实时网络验证来核实,而推理则由以查询特定清单为条件的LLM来评估,并通过基于证据的门控确保无依据的事实使依赖它的判断失效。