论文

OpenCompass:大语言模型 的通用评估平台

OpenCompass: A Universal Evaluation Platform for Large Language Models

AI 基础设施AI 开发与运维平台

摘要

近年来,人工智能领域经历了从特定任务的小规模模型到通用大语言模型(LLM)的范式转变。随着LLM的快速迭代,客观、量化、全面地评估其能力已成为推进技术发展的关键环节。目前主流的基于静态基准数据集的评估方法面临任务类型多样性、评估标准不一致、数据和处理流程碎片化等挑战,难以高效地进行跨领域、大规模的模型评估。针对上述问题,本文提出并开源OpenCompass,一个一站式、可扩展、支持高并发的通用评估平台LLM。该平台秉承模块化、组件解耦的设计理念,拥有高兼容性、灵活性、高并发三大核心优势。 OpenCompass的核心架构由五个关键组件组成:配置系统、任务划分模块、执行与调度模块、任务执行单元和结果可视化模块。其工作流程提供基于规则、LLM-as-a-Judge、级联评估器,以适应不同任务场景的要求。该平台支持知识、推理、计算、科学、语言、代码等多个领域的主流基准数据集,为学术界和工业界提供统一、高效的LLM评估工具,便于准确识别LLM的优缺点以及后续优化。