论文

试验中的评分标准:通过综合成对证据从单个查询演变评分标准

Rubrics on Trial: Evolving Rubrics from a Single Query via Synthetic Pairwise Evidence

模型评测评测方法与指标

摘要

Rubrics 提供结构化、细粒度的信号,用于训练和评估 大语言模型 (LLM)。然而,可靠的特定于查询的规则很难构建。现有的方法通常从人类编写的规则、偏好数据或抽样响应中获得监督。直接查询到标题的生成避免了这些资源,但没有提供明确的检查来证明合理的标题是否有用。这样的评分标准可能无法区分答案质量、奖励可选风格或惩罚有效的替代策略。我们在 Trial 上引入了 Rubrics,这是一个仅查询框架,可以从空集演化出一个 rubric 集,无需外部注释或 模型训练。它仅从合成的评分标准条件响应对中获得监督,并在添加之前验证每个提议的评分标准,筛选出非歧视性的、过于具体的和仅限风格的候选评分标准。五个偏好基准套件的实验证明了 Rubrics on Trial 的有效性,它实现了最佳平均准确度,并在七个评估集中的六个上领先。