开源项目

LM Evaluation Harness:修复评测泄漏与统计错误

EleutherAI/lm-evaluation-harness

模型评测评测方法与指标

概述

LM Evaluation Harness 是语言模型评测工具,统一任务运行和评分,便于比较模型结果。 修复影响模型评测分数的数据泄漏与统计问题,并扩展评测任务。 本次修复会影响评测结果的数据泄漏与统计错误,并扩展评测任务。已有结果在与新版本对比前,应记录原评测版本和配置,必要时重新运行同一批样本。