论文

图结构评分规则:将评分标准编译为LLM裁判的类型化评估图

Graph-Structured Rubrics: Compiling Rubrics into Typed Evaluation Graphs for LLM Judges

模型评测评测方法与指标

摘要

基于评分规则的评估器通常将评分规则视为提示词上下文或扁平判据:它们规定评判什么,却让判据的组合方式保持隐式,即使自然语言规则已明确陈述了组合方式。我们提出图结构评分规则(GSR),在观测响应之前将评分规则编译为与响应无关的类型化评估图。判据节点引出判断;转换、归约和门控算子通过命名端口组合它们;任务特定的输出映射(称为Readout)将唯一汇点转换为分数或偏好。编译会拒绝畸形或类型不兼容的图。逐点评估先分别评判评分规则各维度再进行图聚合;成对评估复用同一图,对每个候选在每个判据下各做一次判断。在GPT-OSS-120B下,GSR在四个逐点数据集上将精确分数一致率较Prometheus式评分提升0.62-6.75个百分点,并在两个偏好基准上于原生平局与弃权策略下取得数值最高的端到端成对准确率。

图结构评分规则:将评分标准编译为LLM裁判的类型化评估图:论文配图
图2:GSR 流程。Compile 在观察候选响应之前固定图结构;Execute 运行判据节点和算子节点;Readout 将汇点分数映射为任务输出。