论文
ExecRubrics:用于可验证高效长文本评估的可执行工具增强量规
ExecRubrics: Executable Tool-Augmented Rubrics for Verifiable and Efficient Long-Form Evaluation
摘要
量规(rubrics)旨在通过把响应质量分解为可解释的标准,使语言模型评估透明化。然而,自然语言量规往往含糊不清,需要黑盒LLM裁判,并且通常假定各标准通过线性加权和独立聚合,限制了其捕捉依赖、替代、惩罚与覆盖条件的能力。我们提出ExecRubrics,一个把量规表示为紧凑可执行程序的框架。ExecRubrics把评估逻辑编码为可验证的Python评分函数,为自然语言量规意图赋予操作语义:一个可检查、可执行、可编辑的固定决策程序。在HealthBench、HelpSteer与ArgQuality三个长文本响应基准上,我们证明ExecRubrics可以在偏好响应与非偏好响应的排序任务中替代昂贵的黑盒裁判,匹配或超越自然语言量规基线,最佳偏好准确率分别为53%、78%与92%,同时将评估延迟最多降低320倍。我们表明,引入NLTK与spaCy等文本处理库的外部逻辑与资源可进一步提升偏好准确率。我们的结果为审视评估提供了一条新路径:相比黑盒量规评估,它更快、更可解释、更少歧义,在医疗与银行等精度与可审计性至关重要的高风险领域尤为适用。
