开源项目

lm-evaluation-harness:v0.4.10拆分核心与后端

EleutherAI/lm-evaluation-harness

模型评测模型能力评测

概述

lm-evaluation-harness是EleutherAI维护的开源大模型评测框架,研究者用它把语言模型放到标准任务上做统一评测。本次v0.4.10正式版拆分核心与后端模块,重构CLI并支持YAML配置,改变了核心模块边界、导入接口和主要评测工作流,既有自定义评测代码升级时需要适配新路径。项目采用MIT许可并提供安装说明,评测结果的可比性依赖按新结构组织任务与后端。