开源项目LM Evaluation Harness:修复评测泄漏与统计错误EleutherAI/lm-evaluation-harnessEleutherAI·来源日期:2026.08.31模型评测评测方法与指标收藏概述LM Evaluation Harness 是语言模型评测工具,统一任务运行和评分,便于比较模型结果。 修复影响模型评测分数的数据泄漏与统计问题,并扩展评测任务。 本次修复会影响评测结果的数据泄漏与统计错误,并扩展评测任务。已有结果在与新版本对比前,应记录原评测版本和配置,必要时重新运行同一批样本。