论文

CalibatedRubric:用于开放式 LLM 评估的任务自适应 Rubric 库

CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation

模型评测评测方法与指标

摘要

对开放式 LLM 输出的可靠评估需要细粒度的标准,但专家管理成本高昂且难以扩展。现有的自动化管道依赖于严格的判断一致性和二元方差过滤器,无法区分可测量的指标和信息丰富的指标。我们引入了 CalibrateRubric,这是一个任务自适应框架,它结合了特定类型的评分、贝叶斯评分标准可测量性过滤和基于项目响应理论 (IRT) 的银行组装。 CalibatedRubric 使用 Beta-Bernoulli 一致性后验估计每个评分标准的可测量性,并使用子模块信息覆盖目标在观察到的能力范围内构建紧凑的评分标准库。在金融、医疗保健、一般和法律基准方面,可测量性过滤将 JudgmentBench 上的与人工标准的一致性从 $κ=0.604$ 提高到 $0.743$。基于 IRT 的贪婪选择比所有六个评估的响应块中的随机选择提高了交叉拟合排名保真度,并且仅需要 49 个而不是 131 个量规即可达到 FinResearchBench 决策支持任务的目标相关性。任务标签扰动进一步减少系统分离,证实任务自适应评分的实际相关性。这些结果支持 CalibrateRubric 作为开放式 LLM 评估的高效、不确定性感知方法,校准增益取决于足够的判断冗余。