开源项目

ai-evaluation-framework:多模型评测与成本统计

dreamers-laboratory/ai-evaluation-framework

模型评测评测方法与指标

概述

ai-evaluation-framework 组织 AI 应用的多模型评测,用统一样本比较输出质量、延迟和调用成本。 以多模型运行、字段评分及延迟和成本统计组织AI应用评测。 框架支持运行多个模型,对输出字段分别评分,并记录延迟和成本。开发者可以在相同输入和评分口径下比较方案,把质量与资源消耗放在同一张评测表中。