论文

DualEval:用于统一 LLM 评估的联合模型项目校准

DualEval: Joint Model-Item Calibration for Unified LLM Evaluation

模型评测评测方法与指标

摘要

当前的 LLM 评估依赖于两个互补但通常互不相关的信号:具有客观正确性标签的静态基准和更好地反映开放式用户交互的竞技场式偏好数据。我们引入了 DualEval,一个潜在的模型-项目校准框架,它在共享空间中表示模型和评估项目,联合评估模型能力以及项目难度和清晰度。我们将 DualEval 应用于四个领域:编码、数学、各种领域知识任务和通用日常用户查询。我们的评估使用 18 个前沿 LLM、静态基准标签和奖励模型分数,根据人类对开放式模型响应的偏好进行验证。根据经验,我们的框架产生可靠且平衡的模型排名,其学习的项目级配置文件支持下游应用,例如用于样本高效评估的基准压缩以及用于污染或异常值分析的异常检测。总体而言,DualEval 通过联合模型项目校准来统一静态和竞技场式评估,生成模型排名和项目级诊断,支持更高效的样本、可解释和可审计的评估流程。