论文

RIFT:量规失效模式分类法与自动化诊断

RIFT: A RubrIc Failure Mode Taxonomy and Automated Diagnostics

模型评测评测方法与指标

摘要

基于评分标准的评估广泛应用于大语言模型基准和开放式、可验证性较差的任务的培训流程中。虽然之前的工作已经证明了使用强化学习结果等下游信号的量规的有效性,但仍然没有原则性的方法来仅根据此类聚合或下游信号来诊断量规质量问题。为了解决这一差距,我们引入了 RIFT:RubrIc 故障模式分类法,这是一种系统地描述标题组成和设计中的故障模式特征的分类法。 RIFT 包含八种故障模式,分为三个高级类别:可靠性故障、内容有效性故障和后果性有效性故障。 RIFT 是使用扎根理论开发的,通过迭代注释从五个不同基准中提取的规则,涵盖一般指令遵循、代码生成、创意写作和专家级深度研究,直到没有发现新的故障模式。我们通过测量独立人类注释者之间的一致性来评估分类法的一致性,观察整体的公平一致性(87% 的成对一致性和 0.64 平均 Cohen's kappa)。最后,为了支持可扩展的诊断,我们提出了自动化的标题质量指标,并表明它们与人类故障模式注释保持一致,实现了高达 0.86 F1。