论文

通过干预转移评估量规生成

Evaluating Rubric Generation with Interventional Transfer

模型评测评测方法与指标安全与风险评测

摘要

特定于实例的评估标准在人工智能基准测试中很常见,其中可靠的评估需要特定的专业知识。这种方法很难扩展,促使人们研究使用大型语言模型 (LLM) 生成评分细则。然而,即使可以提供专家评分标准作为参考,也不清楚如何有效地大规模评估生成的评分标准的质量。在本文中,我们介绍了一种评估评分细则生成的方法,我们将其称为干预迁移(IT),其基于这样的想法:如果对回复施加使其通过或未通过某一细则的干预时,两份细则的评分同步变化,则视为相似。与评分细则生成的现有方法相反,我们认为可以使用不同形式的干预转移来评估生成的评估细则对不同任务的效用。例如,我们在 HealthBench 的案例研究中应用了这种方法,其中我们展示了 Qwen3.8-27B、Deepseek-V4-Flash 和 Opus-5 生成的评分细则的不对称性,用于评估 GPT-5.6-Terra 的响应。降低响应能力的扰动 根据生成的/专家的评分标准,转移到相应的专家/生成的评分标准上的较低分数,但是在一个评分标准上改进的扰动并不能可靠地转移到另一个评分标准上的较高分数。我们认为,这一发现对于使用LLM生成的评分标准进行绩效监控和迭代优化具有影响。我们将我们的方法与现有的评分标准评估方法进行了对比,后者没有表现出我们观察到的同样的不对称性。