论文

RADAR:LLM-as-Judge 评估的Rubric-Aware 依赖性和冗余分析

RADAR: Rubric-Aware Dependency and Redundancy Analysis for LLM-as-Judge Evaluation

模型评测评测方法与指标

摘要

基于Rubric的LLM作为判断管道通常假设评估标准提供独立信号。然而,在实践中,标准可以在行为上耦合:改进一个标准可能会系统地改变另一个标准的分数,从而扭曲模型发布或产品更新决策中使用的总分数。我们引入了 RADAR,这是一种轻量级的飞行前诊断框架,用于在大规模评估之前估计这种耦合。给定一个评分标准,RADAR 会生成有针对性的合成探针,根据所有标准对每个探针进行评分,并生成一个定向耦合矩阵,显示哪些标准共同评分以及如何共同评分。我们在三个行业相关的评估设置上验证 RADAR:NVIDIA HelpSteer2、SumPubMed 和 Yale-Salesforce SummEval 基准。每个标准仅使用少量探针,RADAR 即可恢复人类标准间相关结构(Pearson r > 0.84),并在进行大规模判断之前为从业者提供有关冗余、层次结构和聚合敏感性的具体审核信号。